Hvis du bygger AI-agenter som skal arbeide med store kodebaser, lange logger eller visuelle grensesnitt, er GLM-5.3-Flash en av de mest spennende nye åpne modellene å prøve akkurat nå. Z.ai slapp modellen 26. august med én million tokens kontekst, bilde- og videoforståelse, åpne vekter og en API-pris på bare 0,15 dollar per million input-tokens.

Det er cirka 1,40 kroner per million input-tokens med dollarkursen i slutten av august 2026. Output koster 0,50 dollar, eller omtrent 4,70 kroner per million tokens. Det er nesten komisk billig sammenlignet med hva mange av de sterkeste lukkede modellene koster.

Men navnet «Flash» må ikke lure deg. Dette er ingen liten modell du uten videre laster ned til gaming-PC-en. GLM-5.3-Flash har 320 milliarder parametre totalt, selv om MoE-arkitekturen bare aktiverer 18 milliarder for hvert token. Verdien for folk flest ligger derfor i API-et. De åpne vektene er først og fremst interessante for virksomheter og miljøer med skikkelig maskinvare.

Hva er GLM-5.3-Flash?

GLM-5.3-Flash er den første modellen i GLM-5-serien som er multimodal fra grunnen av. Den kan ta imot tekst, bilder, video og filer i samme arbeidsflyt, har en kontekstgrense på én million tokens og bruker en MoE-arkitektur med 320 milliarder parametre totalt og 18 milliarder aktive per token. Det bekreftes i Z.ai sin dokumentasjon for modellen.

Multimodaliteten er særlig relevant for kodeagenter. En agent kan lese kode, åpne en nettside, se hvordan den faktisk ble rendret og bruke det visuelle resultatet i neste runde. Den samme koblingen kan brukes på skjermbilder, dashboards, dokumenter, presentasjoner og regneark. Det er en mer praktisk form for multimodalitet enn en chatbot som bare beskriver et bilde du laster opp.

Modellen ble først testet anonymt som Ox Alpha på OpenCode og OpenRouter. Det ga utviklere anledning til å prøve den før navnet ble kjent, men sier i seg selv ingenting om kvaliteten. At mange prøver en anonym modell er et signal om interesse. Det forteller ikke at den løste oppgavene deres riktig.

GLM-5.3-Flash følger etter den langt større GLM-5 med 744 milliarder parametre. Flash-utgaven er bygget som en ny basemodell, ikke bare som en kvantisert eller nedskalert variant av forgjengeren. Det er viktig, for hele arkitekturen er endret med effektiv kjøring som mål.

Hvorfor betyr 18 milliarder aktive parametre så mye?

MoE betyr at modellen er delt i mange eksperter, men bare et lite utvalg brukes for hvert token. GLM-5.3-Flash har 288 rutede eksperter og sender hvert token gjennom åtte av dem. Dermed får modellen kapasiteten som følger med et stort samlet parameterantall, uten at alle 320 milliardene må regne på hvert eneste steg.

Det reduserer beregningsarbeidet under inferens, men det fjerner ikke vektene fra minnet. Den vanlige FP8-utgaven er ifølge den tekniske gjennomgangen hos MarkTechPost rundt 306 GiB før KV-cache og annen belastning kommer i tillegg. Det er langt utenfor én RTX 4090. Selv hosting med flere GPU-er krever at maskinvare, minne og serverrammeverk passer sammen.

Dette skillet blir ofte borte når en modell presenteres som «18B aktiv». Aktiv parameterbruk sier noe viktig om kostnaden per token. Det sier ikke at hele modellen har krympet til 18 milliarder parametre på disken eller i GPU-minnet. Vil du bare bruke modellen i en kodeagent, er API derfor den fornuftige inngangen. Lokal kjøring er for dem som har en konkret grunn til å eie hele infrastrukturen.

MoE-arkitektur viser 320 milliarder parametre og 18 milliarder aktive per token
Bare 18 av modellens 320 milliarder parametre aktiveres per token, men alle vektene må fortsatt lagres i minnet.

Hvordan får modellen plass til én million tokens?

GLM-5.3-Flash kombinerer lineær KDA-attention med sparsom NoPE MLA-attention. De lineære lagene holder oversikt over lokale sammenhenger, mens de sparsomme lagene leter etter relevant informasjon lenger bak i konteksten. Z.ai oppgir at denne blandingen kutter attention-beregningene med 3,01 ganger og KV-cachen med 4,44 ganger sammenlignet med GLM-5.3.

Ved én million tokens blir selve søket etter relevante deler av konteksten et problem. Z.ai bruker derfor IndexPool, som komprimerer grupper av nøkkelvektorer med vektet pooling. Det reduserer både minnebruk og forsinkelsen i indekseringen. I tillegg bruker modellen Manifold-Constrained Hyper-Connections, forkortet mHC, for bedre skaleringseffektivitet i den dype arkitekturen.

Resultatet er 45 språkmodellag, omtrent halvparten så mange som GLM-4.5 ved en lignende total modellstørrelse. Dette betyr ikke at alle oppgaver automatisk bør fylle en million tokens. Lange kontekstvinduer koster fortsatt tid og penger, og relevant informasjon kan drukne i støy. Det betyr at modellen har rom for hele kodebaser, omfattende logger og dokumentmengder når oppgaven faktisk krever det.

Én million tokens er heller ikke det samme som perfekt hukommelse. Z.ai sine egne benchmarknotater viser at testene ble kjørt med ulike kontekstgrenser, og bare enkelte brukte hele vinduet. Kontekstgrensen er dokumentert. Hvor godt modellen finner akkurat den ene viktige detaljen langt bak i konteksten, må måles i arbeidsflyten den skal brukes i.

Hva koster GLM-5.3-Flash i praksis?

Standardprisen er 0,15 dollar per million input-tokens, 0,03 dollar for cachet input og 0,50 dollar per million output-tokens. Omregnet med en dollarkurs på omtrent 9,33 kroner er det cirka 1,40 kroner inn, 28 øre for cachet input og 4,70 kroner ut. En forespørsel med én million input-tokens og 100 000 output-tokens vil dermed koste rundt 1,87 kroner før eventuelle andre gebyrer.

Den lave tokenprisen er det sterkeste argumentet her. Én million tokens høres voldsomt ut, men et langt agentløp kan spise tokens fort når modellen leser filer, bruker verktøy, vurderer resultater og prøver på nytt. Lav pris gjør det mulig å teste flere runder og større arbeidsmengder uten at hvert eksperiment føles som et lite strømregningssjokk.

GLM Coding Plan-brukere får modellen med tre ganger så mye brukskvote som GLM-5.3. Z.ai har også et poengsystem der kall utenfor rushtid, inkludert hele helgen, bruker halvparten så mange poeng. For utviklere som allerede arbeider i OpenCode eller andre kompatible kodeverktøy, kan API-et likevel være enklere å måle fordi prisen følger faktisk tokenbruk.

Jeg ville ikke valgt modell bare ved å se på prislisten. Billig output er dyrt hvis agenten gjør jobben tre ganger eller må ryddes opp etterpå. Test derfor en representativ oppgave, logg tokenforbruket og sammenlign både kvalitet, svartid og antall runder mot modellen du bruker i dag. Da får du et regnestykke som betyr noe.

Er benchmarkene gode nok til å stole på?

Z.ai rapporterer 84,3 på Terminal-Bench 2.1. Selskapets øvrige resultater peker også mot en kapabel kode- og agentmodell, men tallene er i hovedsak publisert av Z.ai selv og må leses med det forbeholdet.

Oppsettene varierer også. Modellkortet på Hugging Face oppgir ulike temperaturer, kontekstgrenser, tidsfrister og testmiljøer fra test til test. Det er ryddig at detaljene finnes, men det gjør ikke resultatene direkte overførbare til din oppgave.

Synsdelen er heller ikke best på alt. I tallene Z.ai publiserer, ligger GLM-5.3-Flash bak Gemini 3.7 Flash på blant annet BabyVision og MVBench. Den sterke siden ser ut til å være kombinasjonen av kode, verktøybruk, lang kontekst og pris – ikke at modellen vinner hver enkelt disiplin.

Benchmarks er startstreken, ikke målstreken. Hvis modellen skal endre kode, la den rette en reell feil i et avgrenset repo. Hvis den skal lese kontrakter, gi den et dokumentsett med fasit. Hvis den skal kontrollere et grensesnitt, mål om den faktisk oppdager visuelle feil. Det er mer verdt enn én desimal i en tabell laget av leverandøren.

Hvem bør prøve modellen?

GLM-5.3-Flash passer best for utviklere og team som trenger lange agentløp, store kontekster eller visuell kontroll uten høy tokenpris. Typiske oppgaver er arbeid på tvers av en stor kodebase, analyse av omfattende logger, terminalagenter, nettleserautomatisering og kontroll av ferdige nettsider mot skjermbilder.

Den kan også være aktuell for dokumentarbeid der tekst, tabeller, figurer og layout må forstås sammen. Z.ai fremhever PPTX, PDF, DOCX og XLSX som arbeidsområder. Det er en naturlig videreføring av multimodale modeller som Ovis2.6-80B-A3B, men hoppet fra 64 000 til én million tokens åpner for langt større samlinger i samme kontekst.

Jeg er mer skeptisk til å anbefale lokal kjøring til vanlige brukere. MIT-lisensen gir stor frihet, og Z.ai oppgir støtte for SGLang, vLLM, TokenSpeed og KTransformers. Maskinvarekravet for den offisielle FP8-utgaven gjør likevel at «åpne vekter» og «kjører hjemme» er to helt forskjellige påstander. Vil du eksperimentere lokalt på 24 GB VRAM, finnes det langt mer realistiske modeller, som Muse Glimmer på 30 milliarder parametre.

For de fleste er rådet enkelt: prøv GLM-5.3-Flash via API på en oppgave du kjenner godt. Ikke gi den tilgang til kritiske systemer før du har målt stabiliteten, og ikke send sensitiv informasjon uten å ha kontroll på vilkår og databehandling. Billig og kapabel er en lovende kombinasjon. Det er fortsatt du som må finne ut om modellen kan stoles på i akkurat din arbeidsflyt.

Det er her denne utgivelsen skiller seg ut. Z.ai har ikke laget en «liten» modell, men en stor modell som bare bruker en liten del av kapasiteten per token og kan serveres svært billig. Med åpne MIT-lisensierte vekter, én million tokens og multimodal agentbruk har GLM-5.3-Flash en pakke som fortjener mer enn et blikk på benchmarktabellen. Nå gjenstår den delen som alltid teller mest: hva den leverer når den møter ekte arbeid.

Ofte stilte spørsmål

Kan GLM-5.3-Flash kjøres på en RTX 4090?

Ikke den offisielle FP8-utgaven alene. Vektene er rundt 306 GiB før KV-cache og annen minnebruk, mens en RTX 4090 har 24 GB VRAM. Mindre tredjepartskvantiseringer kan komme, men 320 milliarder totalparametre gjør dette til en svært tung lokal modell.

Er GLM-5.3-Flash virkelig open source?

Modellvektene ligger på Hugging Face med MIT-lisens, som gir svært vide rettigheter til bruk og endring. «Open weights» er likevel den mest presise beskrivelsen når treningsdata og hele treningsprosessen ikke er publisert på samme måte som kildekode.

Fungerer modellen med OpenAI-kompatible verktøy?

Ja. Z.ai tilbyr modellen via API, og Hugging Face viser oppsett for blant annet vLLM og SGLang med et OpenAI-kompatibelt chat-endepunkt. Kontroller modell-ID, thinking-innstillinger og multimodalt meldingsformat mot den nyeste dokumentasjonen før du kobler den til en agent.

Er én million tokens alltid bedre enn et mindre kontekstvindu?

Nei. Stor kontekst gir plass til mer materiale, men kan øke svartid, pris og mengden støy modellen må sortere. Bruk hele vinduet når oppgaven krever det, og test om modellen faktisk finner riktige detaljer langt bak i konteksten.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre i et mørkt videoredigeringsstudio med flere skjermer som viser LTX Video 2.3 frames fra en kafé-POV-scene

LTX Video 2.3 – 481 frames og 20 sekunder video på 2,5 minutt lokalt

LTX Video 2.3 (versjon 0.9.8) genererer 20 sekunder vertikal POV-video med 481 frames på 2 minutter og 26 sekunder på RTX 4090. Her er hva som er nytt, hva modellen krever, og hvorfor dette er den sterkeste lokale video-AI-modellen akkurat nå.