Qwen3.8-Flash-Next gir oss den første åpne forhåndsvisningen av arkitekturen som skal drive Qwen4. Den kombinerer 125 milliarder hovedparametere med 51 milliarder n-gram-parametere, men aktiverer bare 6 milliarder av hovedmodellen for hvert token. Det er spennende. Det betyr bare ikke at dette er en liten 6B-modell som glir rett inn på én vanlig GPU.

Det viktige her er hvordan Qwen forsøker å skille modellkapasitet fra regnekostnad. Sparse attention skal redusere kostnaden ved lange kontekster, n-gram-tabellen kan flyttes til systemminnet, og MoE-oppsettet lar modellen bruke en liten del av ekspertvektene om gangen. Det peker rett mot agenter som skal arbeide lenge med store kodebaser, dokumenter, bilder og verktøy.

Jeg er skeptisk til kinesiske modeller, men åpne vekter og et teknisk notat gjør denne lanseringen langt mer interessant enn enda en API-modell med pene tall. Samtidig bør ingen lese «6B aktivert» som «6B å laste ned». Den forskjellen er hele saken.

Qwen4-arkitekturen kommer før Qwen4

Qwen3.8-Flash-Next er en eksperimentell, multimodal MoE-modell og en tidlig versjon av arkitekturen Qwen vil bruke i Qwen4. I det offisielle repositoriet forklarer Qwen at modellen spiller samme rolle som Qwen3-Next gjorde før Qwen3.5: Arkitekturendringene slippes med åpne vekter, slik at miljøet kan undersøke dem før neste fulle modellfamilie kommer.

Det gjør «Next» viktigere enn «3.8» i navnet. Dette er ikke bare en raskere variant av Qwen3.8-27B. Qwen har endret oppmerksomhetsmekanismen, residualstrømmen, embedding-laget og treningsoppskriften. Modellen tar imot tekst, bilder og video, og er trent både før og etter den grunnleggende pretrain-fasen.

Vektene ble publisert 26. august 2026, og modellkortet på Hugging Face oppgir lisensen som Qwen Community License 1.0. Det korrekte begrepet er derfor åpne vekter, ikke automatisk open source. Hva du kan distribuere, endre og bruke kommersielt, må vurderes mot den faktiske lisensen.

Diagram over Qwen3.8-Flash-Next med 180 milliarder parametere og seks milliarder aktive
Seks milliarder aktive hovedparametere betyr lavere regnearbeid per token. Det betyr ikke at resten av modellens vekter forsvinner.

Hva betyr 125B med 6B aktivert?

Qwen3.8-Flash-Next har en hovedmodell på 125 milliarder parametere, men bruker 6 milliarder per token. I tillegg kommer 51 milliarder n-gram-parametere og 4 milliarder parametere til MTP. MoE-laget har 512 eksperter, hvor 10 rutede eksperter og én delt ekspert aktiveres for hvert token.

Dette er grunnen til at modellen kan bruke mindre regnekraft per token enn en tett modell på 125 milliarder parametere. Den trenger ikke kjøre alle ekspertene for hvert ord. Men alle ekspertvektene må fortsatt finnes et sted. Aktivt parameterantall sier mest om regnearbeidet under inferens. Det sier ikke alene hvor mye lagring, RAM eller VRAM hele modellen krever.

Skillet mellom total og aktiv størrelse er heller ikke unikt for Qwen. DeepSeek V4 Pro og Flash bruker det samme MoE-prinsippet i langt større skala: Mange vekter må lagres, mens bare en mindre del jobber med hvert token.

En enkel størrelsessjekk er nok til å punktere 6B-misforståelsen. Hovedmodellen, n-gram-tabellen og MTP-laget summerer seg til rundt 180 milliarder parametere. Selv ved i gjennomsnitt én byte per parameter snakker vi grovt om 180 GB bare til vekter, før cache og annen overhead. Lavere kvantisering og offloading kan presse behovet ned, men da er vi fortsatt i en helt annen verden enn en ekte 6B-modell.

Qwen oppgir at n-gram-tabellen egner seg spesielt godt for offloading til systemminnet. Det er smart, fordi oppslag i en slik tabell krever langt mindre beregning enn å kjøre et nytt MoE-lag. Det kan gjøre modellen mer praktisk på maskiner med mye RAM og mindre GPU-minne. «Mer praktisk» er likevel ikke det samme som «liten».

Hvorfor kan Qwen Sparse Attention bety noe?

Qwen Sparse Attention, forkortet QSA, velger relevante deler av konteksten i blokker fremfor å la full attention behandle alt mot alt. Modellen bruker tre Gated DeltaNet-lag for hvert QSA-lag, gjentatt gjennom 48 lag. QSA-budsjettet er 512 blokker, tilsvarende 2 048 token.

Dette angriper et reelt problem. Når en kodeagent arbeider med hundretusener av token, blir vanlig full attention dyrere jo lengre historikken blir. Gated DeltaNet komprimerer den løpende historikken, mens QSA bruker en lett indeks til å hente de delene som ser viktige ut. Hvis dette fungerer godt uten at modellen overser avgjørende detaljer, kan lange agentøkter bli både raskere og billigere å kjøre.

Qwen oppgir en innebygd kontekst på 262 144 token. Den kan utvides til 1 million token med YaRN, men det er en utvidelse, ikke modellens vanlige lokale standard. Til sammenligning er den kommersielle Qwen3.8-Flash-utgaven basert på denne modellen, men leveres med 1 million token som standard og flere produksjonsfunksjoner. Flash-Next er arkitekturlaboratoriet. Flash er tjenesten.

Gated Residual er den andre delen som fortjener oppmerksomhet. Residualstrømmen utvides til fire grener, og modellen styrer lesing og skriving med porter. Målet er bedre informasjonsflyt gjennom dype nettverk uten høy inferenskostnad. Dette er mindre lett å selge i en overskrift enn «1 million token», men kan være like viktig hvis det gir mer stabil trening og bedre bruk av modellkapasiteten.

Hva er nytt med n-gram-embedding?

N-gram-embedding gir modellen en tabell med 20 millioner oppføringer basert på kombinasjoner av to og tre token. Tabellen ligger ved lag to og tilfører 51 milliarder parametere. Tanken er at modellen kan slå opp lokale mønstre direkte, i stedet for å bruke mer beregning i alle de øvrige lagene.

Det minner om en enorm mønstertabell som hjelper modellen å kjenne igjen vanlige lokale kombinasjoner raskt. Kapasiteten øker kraftig, mens oppslaget er billigere enn en tilsvarende økning i aktive MoE-parametere. Fordi tabellen kan ligge i systemminnet og hentes asynkront, kan Qwen la GPU-en fortsette annet arbeid mens nødvendige oppføringer flyttes inn.

Dette er antakelig modellens mest spennende lokale egenskap – og samtidig den som trenger mest praktisk testing. Minnebåndbredde, PCIe-overføring, kvantisering og støtte i inferensmotoren kan avgjøre om løsningen faktisk er rask på en arbeidsstasjon. En god arkitekturtegning flytter som kjent ingen byte gjennom PCIe-bussen. Her må quants og målinger få siste ord.

Diagram over n-gram-offloading mellom systemminne, PCIe og GPU i Qwen3.8-Flash-Next
N-gram-tabellen kan ligge i systemminnet og hentes asynkront. Den praktiske ytelsen avhenger derfor av blant annet minnebåndbredde og PCIe-overføring.

Kan Qwen3.8-Flash-Next kjøres lokalt?

Ja, Qwen3.8-Flash-Next kan kjøres lokalt, men maskinvarekravet avhenger kraftig av kvantisering, kontekstlengde og hvor mye som flyttes til RAM. Qwen oppgir støtte for Transformers, vLLM, SGLang, TokenSpeed og llama.cpp. Modellkortet anbefaler nyeste versjon av inferensrammeverket fordi støtte og ytelse varierer.

Qwens offisielle vLLM-oppskrift bruker vllm serve Qwen/Qwen3.8-Flash-Next --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder. SGLang og TokenSpeed har tilsvarende oppskrifter, mens llama.cpp-brukere må velge en kompatibel GGUF-kvantisering. Ikke anta at en tilfeldig eldre installasjon forstår arkitekturkoden qwen4_exp. Oppdater motoren, les dokumentasjonen til den aktuelle quanten og kontroller at både tekst og vision er testet.

Modellen tenker som standard og legger reasoning foran sluttsvaret. For direkte svar kan enable_thinking settes til false. Qwen anbefaler temperature=1.0, top_p=0.95 og top_k=20 i thinking-modus. I non-thinking-modus er anbefalingen temperature=0.7, top_p=0.80, top_k=20 og presence_penalty=1.5.

Det finnes allerede støtte og quants i økosystemet, men utgivelsesdagen er et dårlig tidspunkt å late som om alle kombinasjoner er modne. Vent på dokumenterte filstørrelser, hastighet, minnebruk og kvalitet fra den quanten du faktisk vurderer. Hvis målet bare er å kjenne på modellen, er et API langt mindre arbeid enn å laste ned titalls eller hundrevis av gigabyte på håp.

Er modellen god nok til koding og agenter?

Qwens egne resultater peker mot at Flash-Next er bygget for koding, verktøybruk og lange arbeidsløp. Modellen scorer 62,5 på SWE-bench Pro, 73,5 på Toolathlon Verified og 73,9 på Qwens egen CoWorkBench. Det er sterke tall, men leverandørtester er fortsatt leverandørtester.

Resultatene er mer nyttige som et kart over ambisjonene enn som et kjøpsbevis. Qwen har evaluert flere modeller med bestemte agentrammeverk, temperaturer og 256K-kontekst. Bytter du runtime, prompt, quant eller maskinvare, kan både kvalitet og hastighet endre seg. En modell som vinner én kodebenchmark kan fortsatt rote seg bort i din kodebase.

Den relevante sammenligningen er derfor ikke bare mot Claude eller DeepSeek på en tabell. For lokal bruk bør Flash-Next sammenlignes med langt mindre Qwen-modeller som faktisk er enkle å kjøre, og med Qwen-modeller som er tilgjengelige via API. Mer kapasitet hjelper lite hvis oppsettet blir så tregt at agenten aldri får gjort jobben.

Min dom på utgivelsesdagen

Qwen3.8-Flash-Next er en modig utgivelse fordi Qwen slipper selve arkitektureksperimentet med vekter og tekniske detaljer før Qwen4. Det gir utviklere mulighet til å teste QSA, n-gram-embedding og Gated Residual i praksis. LocalLLaMA-tråden for utgivelsen samler quants, templates, serverstøtte og erfaringer etter hvert som de kommer.

Men ikke kjøp 6B-fortellingen. Seks milliarder aktive parametere kan gi lavere beregningskostnad per token, mens hele modellen fortsatt krever plass til rundt 180 milliarder parametere. Det er nettopp kombinasjonen Qwen prøver å gjøre håndterbar gjennom sparsitet og offloading. Om de har lykkes på vanlig lokal maskinvare, avgjøres av reelle målinger – ikke av bokstaven B.

Jeg ville fulgt med på tre ting: stabile GGUF-er og runtime-støtte, faktisk hastighet når n-gram-tabellen ligger i RAM, og kvalitetstapet ved kvantisering. Leverer modellen der, kan denne arkitekturen bli et viktig steg mot lokale agenter med mye større kapasitet enn den aktive regnekostnaden tilsier. Hvis ikke, har vi fått et spennende teknisk notat som spiser RAM til frokost.

Ofte stilte spørsmål

Er Qwen3.8-Flash-Next en 6B-modell?

Nei. Modellen aktiverer 6 milliarder parametere per token, men har 125 milliarder hovedparametere, 51 milliarder n-gram-parametere og 4 milliarder MTP-parametere. Aktivt parameterantall sier noe om regnearbeidet, ikke hvor mange vekter som må lagres.

Hvor mye minne trenger Qwen3.8-Flash-Next?

Det finnes ikke ett riktig tall. Behovet avhenger av quant, kontekst, cache, runtime og offloading. Rundt 180 milliarder samlede parametere betyr likevel at modellen ikke bør behandles som en vanlig 6B-modell. Sjekk minnetallene for den konkrete quanten før nedlasting.

Støtter Qwen3.8-Flash-Next bilder og video?

Ja. Det er en multimodal modell med vision encoder og støtte for tekst, bilder og video. Offisiell dokumentasjon viser bruk gjennom Transformers, vLLM og SGLang. Kontroller at inferensmotoren og quanten du velger, støtter multimodal input – ikke bare tekst.

Er Qwen3.8-Flash-Next det samme som Qwen3.8-Flash?

Nei. Flash-Next er den åpne, eksperimentelle arkitekturforhåndsvisningen. Den kommersielle Qwen3.8-Flash bygger på samme grunnlag, men har blant annet 1 million token som standard og offisielle innebygde verktøy. Navnene er like nok til å skape rot, selvfølgelig.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre i et mørkt videoredigeringsstudio med flere skjermer som viser LTX Video 2.3 frames fra en kafé-POV-scene

LTX Video 2.3 – 481 frames og 20 sekunder video på 2,5 minutt lokalt

LTX Video 2.3 (versjon 0.9.8) genererer 20 sekunder vertikal POV-video med 481 frames på 2 minutter og 26 sekunder på RTX 4090. Her er hva som er nytt, hva modellen krever, og hvorfor dette er den sterkeste lokale video-AI-modellen akkurat nå.