Jan Sverre i en visuell fremstilling av Qwen3.8-Flash-Next og modellens parameterforskjell

Qwen3.8-Flash-Next viser Qwen4-arkitekturen – men dette er ingen liten 6B-modell

Qwen3.8-Flash-Next gir en åpen forhåndsvisning av Qwen4-arkitekturen. Her er hva 6B aktive parametere, QSA og 262 144 token betyr for lokal kjøring i praksis.
Jan Sverre utforsker Ox Alpha fra Z.AI og løftet om åpne modellvekter

Z.AI bekrefter Ox Alpha – åpne modellvekter kommer

Ox Alpha fra Z.AI får åpne modellvekter. Se hva som er bekreftet om lokal kjøring, databruk, GLM-5.3 og påstanden om at modellen faktisk utfordrer DeepSeek.
Jan Sverre med IBM Granite 4.2 som lokal AI-agent på egen maskin

IBM Granite 4.2 gjør lokale AI-agenter mer praktiske

IBM Granite 4.2 har 3B-, 8B- og 30B-modeller for lokale AI-agenter, med justerbar reasoning og agenttrening. Se hvorfor 8B er det naturlige startpunktet.
Jan Sverre illustrerer Qwens ledelse blant åpne AI-modeller med tre milliarder nedlastinger

Qwen passerer 3 milliarder nedlastinger – slår Meta og Google

Qwen har passert 3 milliarder nedlastinger på seks måneder og gått forbi Meta og Google. Slik ble Alibaba størst blant åpne AI-modeller på Hugging Face.
Jan Sverre illustrerer Muse Glimmer som lokal 30B-agentmodell innenfor 24 GB

Muse Glimmer: lokal 30B-agentmodell for 24 GB VRAM

Muse Glimmer er Metas 30B-modell med åpne vekter for lokale AI-agenter. Den offisielle 4-bit-utgaven på 17 GB er laget for maskinvare med 24 GB minne.
Jan Sverre i visuell debatt om AI-musikk, kreativitet og nye verktøy

AI-musikk er musikk – men et tastetrykk gjør deg ikke til komponist

AI-musikk har lav terskel, men resultatet er fortsatt musikk. Det interessante er hvem som har formet uttrykket, hvor mye arbeid som ligger bak, og om opphavsretten er respektert.
Jan Sverre illustrerer Solar Open 2 og lokale AI-agenter med lang kontekst

Solar Open 2 gir AI-agenter én million tokens – men krever fire H200

Solar Open 2 kombinerer én million tokens med 15B aktive parametere for AI-agenter. Den fulle 250B-modellen krever minst fire Nvidia H200-kort lokalt.
Jan Sverre ved skrivebordet med llama.cpp-terminaler som viser MTP-aktivert inferens

MTP merget inn i llama.cpp – nå kan alle kjøre det

PR 22673 er merget inn i llama.cpp master. MTP-støtte gir 1,9x til 2,5x raskere inferens lokalt – her er hva du trenger å vite og hvordan du aktiverer det.
Jan Sverre utforsker Gemma-4-31B-it-DFlash og spekulativ dekoding med DFlash-teknikken

Gemma-4-31B-it-DFlash – spekulativ dekoding for Googles åpne modell

Gemma-4-31B-it-DFlash er en ny variant av Googles Gemma 4 31B utgitt av Z Lab, med DFlash spekulativ dekoding som kan gi opptil 8x raskere inferens. Llama.cpp-støtte er under utvikling via PR #22105.
Jan Sverre utforsker Gemma 4 fra Google med Apache 2.0-lisens og fire nye åpne AI-modeller

Gemma 4 – Google lanserer åpne AI-modeller med Apache 2.0-lisens

Google lanserte Gemma 4 den 2. april 2026 med Apache 2.0-lisens – den første Gemma-modellen som er fullt åpen for kommersiell bruk. Fire varianter fra 2,3 til 31 milliarder parametere, multimodal støtte og 128-256K kontekstvindu.