Tencent Hy3 er ute med Apache 2.0 – 295B parametre og 21B aktive
Tencent Hy3 er ute med Apache 2.0, 295B parametre, 21B aktive og 256K kontekst. For norske AI-byggere er lisensen mer praktisk enn benchmarkene akkurat nå.
6. juli 2026
31 visninger
7 minutter lesetid
Chatterbox: lokal, gratis norsk stemmekloning – men bare hvis du gjør det riktig
Chatterbox lover lokal, gratis norsk stemmekloning uten sky. Jeg testet det på RTX 4090 – her er hva som faktisk funker, og hva som gjør det syntetisk.
20. juni 2026
55 visninger
8 minutter lesetid
North Mini Code kjører på én GPU – det er hele poenget
Coheres nye kodingsmodell North Mini Code er en 30B MoE-modell med bare 3B aktive parametre – laget for å kjøre på én H100 og håndtere agentic coding.
11. juni 2026
69 visninger
5 minutter lesetid
Perplexity løser personvernproblemet med lokal AI – slik fungerer den nye smartruting-funksjonen
Perplexity AI lanserer hybrid lokal-sky-ruting som automatisk velger om AI-oppgaver kjøres på din PC eller i skyen. Slik fungerer det i praksis.
5. juni 2026
73 visninger
4 minutter lesetid
PewDiePie brukte et år på sitt eget AI-arbeidsrom – her er hva Odysseus faktisk er
PewDiePie har laget et selv-hostet AI-arbeidsrom kalt Odysseus. Det er ikke et ChatGPT-alternativ – det er cockpiten rundt modellen du selv velger. Her er hva det faktisk er.
1. juni 2026
129 visninger
8 minutter lesetid
Er frontier-AI for dyrt? Slik beregner du om lokal AI lønner seg
Prisen på GPT-5.5 er tredoblet på åtte måneder. Her er regnestykket som avgjør om lokal AI og open source er verdt overgangen for deg.
28. mai 2026
78 visninger
4 minutter lesetid
Slik får du nesten 5x raskere lokal AI på én RTX 3090 – BeeLlama v0.2.0 forklart
BeeLlama v0.2.0 gir opptil 4,9x raskere tekstgenerering med Gemma 4 31B og Qwen3.6 27B på én enkelt RTX 3090 – uten ekstra maskinvare.
27. mai 2026
82 visninger
5 minutter lesetid
MiniCPM5-1B – reasoning og tool use på 1 milliard parametere
MiniCPM5-1B er en 1B-modell med hybrid reasoning, 131 000 tokens kontekst og tool use – og kjører lokalt via Ollama. Her er hva den faktisk kan.
26. mai 2026
97 visninger
4 minutter lesetid
DeepSeek V4 Flash lokalt på fire RTX 2080 Ti – 255 tokens per sekund for under 25 000 kr
Noen kjørte DeepSeek V4 Flash lokalt på fire brukte RTX 2080 Ti-er til under 25 000 kr – og fikk 255 prefill tokens per sekund. Her er hva de brukte og hvordan det fungerer.
20. mai 2026
128 visninger
4 minutter lesetid
Gemma-4-31B-it-DFlash – spekulativ dekoding for Googles åpne modell
Gemma-4-31B-it-DFlash er en ny variant av Googles Gemma 4 31B utgitt av Z Lab, med DFlash spekulativ dekoding som kan gi opptil 8x raskere inferens. Llama.cpp-støtte er under utvikling via PR #22105.