Laguna S 2.1 gjør avansert AI-koding mulig på én maskin
Laguna S 2.1 er en open-weight kodemodell for langvarig agentarbeid. Den kan kjøre på én kraftig 128 GB-maskin, men krever både minne og tålmodighet.
22. juli 2026
81 visninger
8 minutter lesetid
Hugging Face hacket av AI-agent – forsvarerne svarte med lokal AI
Et autonomt AI-agentsystem angrep Hugging Face. Se hvordan lokal AI analyserte over 17 000 hendelser da kommersielle modeller stanset etterforskningen.
20. juli 2026
66 visninger
8 minutter lesetid
Test av Ternary Bonsai 27B lokalt på RTX 4090
Jeg testet Ternary Bonsai 27B på RTX 4090. Modellen er 7,2 GB, leverte 83-85 token/s og klarte JSON, dokumentarbeid, tool calling og vision.
16. juli 2026
93 visninger
9 minutter lesetid
MiMo-V2.5-DFlash kan gjøre lokal AI raskere – men oppskriften mangler
MiMo-V2.5-DFlash har fått offisielle vekter på Hugging Face. Se hva Xiaomi har publisert, hvordan DFlash virker og hvorfor ytelsen fortsatt er ukjent.
13. juli 2026
89 visninger
7 minutter lesetid
Moondream 3.1 gjør lokal bildeanalyse med 2 milliarder aktive parametere
Moondream 3.1 er en lokal synsspråkmodell for bildeanalyse. Se hva 2 milliarder aktive parametere, fire funksjoner, API-pris og lisens betyr i praksis.
13. juli 2026
87 visninger
7 minutter lesetid
Tencent Hy3 er ute med Apache 2.0 – 295B parametre og 21B aktive
Tencent Hy3 er ute med Apache 2.0, 295B parametre, 21B aktive og 256K kontekst. For norske AI-byggere er lisensen mer praktisk enn benchmarkene akkurat nå.
6. juli 2026
94 visninger
7 minutter lesetid
Chatterbox: lokal, gratis norsk stemmekloning – men bare hvis du gjør det riktig
Chatterbox lover lokal, gratis norsk stemmekloning uten sky. Jeg testet det på RTX 4090 – her er hva som faktisk funker, og hva som gjør det syntetisk.
20. juni 2026
130 visninger
8 minutter lesetid
North Mini Code kjører på én GPU – det er hele poenget
Coheres nye kodingsmodell North Mini Code er en 30B MoE-modell med bare 3B aktive parametre – laget for å kjøre på én H100 og håndtere agentic coding.
11. juni 2026
118 visninger
5 minutter lesetid
Perplexity løser personvernproblemet med lokal AI – slik fungerer den nye smartruting-funksjonen
Perplexity AI lanserer hybrid lokal-sky-ruting som automatisk velger om AI-oppgaver kjøres på din PC eller i skyen. Slik fungerer det i praksis.
5. juni 2026
133 visninger
4 minutter lesetid
PewDiePie brukte et år på sitt eget AI-arbeidsrom – her er hva Odysseus faktisk er
PewDiePie har laget et selv-hostet AI-arbeidsrom kalt Odysseus. Det er ikke et ChatGPT-alternativ – det er cockpiten rundt modellen du selv velger. Her er hva det faktisk er.
1. juni 2026
205 visninger
8 minutter lesetid
Er frontier-AI for dyrt? Slik beregner du om lokal AI lønner seg
Prisen på GPT-5.5 er tredoblet på åtte måneder. Her er regnestykket som avgjør om lokal AI og open source er verdt overgangen for deg.
28. mai 2026
135 visninger
4 minutter lesetid
Slik får du nesten 5x raskere lokal AI på én RTX 3090 – BeeLlama v0.2.0 forklart
BeeLlama v0.2.0 gir opptil 4,9x raskere tekstgenerering med Gemma 4 31B og Qwen3.6 27B på én enkelt RTX 3090 – uten ekstra maskinvare.
27. mai 2026
134 visninger
5 minutter lesetid
MiniCPM5-1B – reasoning og tool use på 1 milliard parametere
MiniCPM5-1B er en 1B-modell med hybrid reasoning, 131 000 tokens kontekst og tool use – og kjører lokalt via Ollama. Her er hva den faktisk kan.
26. mai 2026
174 visninger
4 minutter lesetid
DeepSeek V4 Flash lokalt på fire RTX 2080 Ti – 255 tokens per sekund for under 25 000 kr
Noen kjørte DeepSeek V4 Flash lokalt på fire brukte RTX 2080 Ti-er til under 25 000 kr – og fikk 255 prefill tokens per sekund. Her er hva de brukte og hvordan det fungerer.