Innhold Vis
DeepSeek V4.1 Flash angriper kostnaden ved lange AI-agentløp der den faktisk oppstår: i cache, minnetrafikk og gjentatt behandling av enorme mengder input. Modellen støtter 1 million tokens, men tallet som virkelig betyr noe er 890 byte global KV-cache per token.
Ved full kontekst tilsvarer det omtrent 890 MB global KV-cache for én sekvens, før andre data og driftskostnader regnes med. DeepSeek oppgir at dette er rundt en firedel av V4 Flash og 437 ganger mindre enn den første DeepSeek-generasjonen. Det er en ganske brutal forbedring på få modellgenerasjoner.
Jeg er skeptisk til å stole på en leverandørs egne resultater uten uavhengige tester. Men selve ingeniørarbeidet her fortjener oppmerksomhet. Millionkontekst har lenge sett flott ut i en spesifikasjon og langt mindre flott på serverregningen. V4.1 Flash er bygd for å gjøre den forskjellen mindre.
Hvorfor blir lang kontekst så dyrt?
En språkmodell lagrer nøkler og verdier fra tidligere tokens i en KV-cache, slik at den slipper å beregne hele samtalen på nytt for hvert nye ord. Når konteksten vokser til 1 million tokens og mange agenter arbeider samtidig, blir denne cachen en belastning på GPU-minne, systemminne, SSD og båndbredde.
Dette er spesielt viktig for langvarige AI-agenter. De kan lese store kodebaser, dokumentarkiver, logger og en voksende historikk av verktøykall. Hver gang systemet må gjøre en ny prefill, behandles mye input før modellen kan fortsette å svare. Kontekstvinduet kan altså være stort på papiret uten at det er økonomisk fornuftig å fylle det.
DeepSeek har tidligere forklart arkitekturen bak FP4-trening og komprimert oppmerksomhet i V4. I V4.1 Flash er målet enda tydeligere: færre byte må lagres, mindre arbeid må gjentas, og flere lag må dele det som allerede er beregnet.
Hva er DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash er en multimodal Mixture-of-Experts-modell med 552 milliarder backbone-parametere, 196 milliarder ekstra Engram-parametere og støtte for opptil 1 million tokens. Den behandler både bilder og tekst og genererer tekst. Modellvektene er publisert på Hugging Face med MIT-lisens.
De enorme totaltallene betyr ikke at alle parameterne brukes for hvert token. Modellen aktiverer 8 milliarder parametere per token under prefill og 16 milliarder under dekoding. Hvert MoE-lag har én delt ekspert og 384 rutede eksperter, men bare seks av de rutede ekspertene aktiveres per token.
Det gjør beregningen langt mer effektiv enn en tett modell med samme totale størrelse, men dette er fortsatt ingen liten modell for en vanlig PC. DeepSeek leverer en referanseimplementasjon med tensorparallell kjøring over åtte prosesser. Poenget med åpne vekter er friheten til å undersøke, tilpasse og drifte modellen – ikke at 552 milliarder parametere plutselig får plass under skrivebordet.
Causal Encoder-Decoder kutter prefill-arbeidet
Modellen har 40 Transformer-lag fordelt på en kausal encoder med 20 lag og en decoder med 20 lag. Prompten går gjennom encoderen, mens decoderens globale KV-data projiseres fra encoderens siste skjulte tilstand. Dermed trenger ikke alle prompt-tokenene å kjøres gjennom hele decoderstakken under prefill.
Det er grunnen til at V4.1 Flash aktiverer 8 milliarder parametere per token i prefill, mot 16 milliarder under selve dekodingen. For arbeidslaster med mye input og relativt korte svar kan dette være viktigere enn hvor fort modellen spytter ut neste token. En agent som stadig leser 100 000 nye tokens, bruker tross alt mye tid før første svarbit kommer.
Modellen beholder samtidig sliding-window attention med et vindu på 128 tokens i alle lag. DeepSeek lagrer ikke denne delen av KV-cachen permanent på SSD. Ved behov bygges den opp igjen ved å spille av bare de siste 128 prompt-tokenene. Selskapet kaller løsningen SWA Bounded Replay og hevder at den vedvarende KV-cachen dermed faller til omtrent en åttedel av nivået i V4 Flash.
CSA2 lar lagene gjenbruke oppmerksomhet
Compressed Sparse Attention 2 deler lagene inn i tre faste moduser: Full, Reindex og Reuse. Et Full-lag beregner sin egen hovedcache og velger opptil 512 relevante posisjoner. Reindex-lag gjenbruker cachedata, men vurderer kandidatene på nytt. Reuse-lag gjenbruker både cachedata og de valgte posisjonene.
I encoderens 18 CSA2-lag er lagene ordnet i tre grupper på seks, med ett Full-lag og fem Reuse-lag i hver gruppe. Decoderens 20 lag er delt i fem grupper på fire. Første gruppe begynner med Full, mens de neste begynner med Reindex; de tre øvrige lagene i hver gruppe bruker Reuse.
Decoderens hierarkiske indeksering begrenser kandidatsettet til maksimalt 16 384 posisjoner, bygget av 2 048 blokker med åtte posisjoner i hver. Dypere lag slipper dermed å lete gjennom hele millionkonteksten på nytt. Dette er ikke bare komprimering. Det er bevisst gjenbruk av arbeid på tvers av lag.
FP4-cache får hvert token ned til 890 byte
Hoveddelen av KV-cachen lagres i FP4-formatet E2M1, med én E4M3-skaleringsverdi per 16 kanaler. Kvantiseringen ble innført med quantization-aware training i ettertreningen. Ifølge DeepSeeks tekniske rapport kutter dette lagringen omtrent i to sammenlignet med FP8-cachen i V4.
FP4 alene forklarer likevel ikke hele reduksjonen. Gevinsten kommer fra kombinasjonen av lav presisjon, deling av hovedcache mellom lag, gjenbruk av utvalgte posisjoner og at den lokale sliding-window-cachen kan bygges opp igjen. Det er nettopp kombinasjonen som får den globale cachen ned til 890 byte per token.
På driftssiden legger DeepSeek den kortlivede SWA-cachen i en distribuert pott som bruker 10 prosent av vertsmaskinenes DRAM og beholder data i noen minutter. Den globale KV-cachen får en garantert levetid på 72 timer. Det viser hvilken arbeidslast modellen er tegnet for: agenter som kan fortsette lenge, forsvinne en stund og komme tilbake uten at hele tilstanden må bygges fra bunnen.
Hva betyr dette for AI-agenter?
For agentutviklere betyr V4.1 Flash at lang historikk kan bli mindre dyr å holde levende. Lavere cachebehov kan gi plass til flere samtidige sesjoner per maskin, mindre trafikk mellom minnenivåene og færre dyre omstarter. DeepSeek oppgir også at beregningsbehovet for ett dekodet token bare øker med en firedel når konteksten går fra 4 000 til 1 million tokens.
Det betyr ikke at alle agenter bør få en million tokens. En full kontekst kan fortsatt inneholde gammelt rot, duplikater og opplysninger som trekker modellen i feil retning. God henting, oppsummering og styring av arbeidsminnet forsvinner ikke fordi cachen blir mindre. Søppel inn er fremdeles søppel inn – nå bare med et mer effektivt lager.
DeepSeek trente modellen på 45 billioner multimodale tokens, med et forhold på 7 til 1 mellom tekst og multimodale data. Konteksten ble utvidet til 1 million tokens etter 34 billioner treningstokens. Det er et mer solid utgangspunkt enn å lime et enormt kontekstvindu på en ferdig modell, men den praktiske verdien avhenger fortsatt av hvor godt modellen finner og bruker riktig informasjon langt tilbake.
Sterke agentresultater må leses med riktig skepsis
DeepSeek viser til en toppplassering på Terminal-Bench 2.1 og DeepSWE v1.1 i sin egen tabell. På Terminal-Bench 4.0 ligger modellen derimot tydelig bak den beste oppgitte konkurrenten. Det er et godt eksempel på hvorfor én benchmarkseier ikke er en dom over hele modellen.
Benchmarkene er kjørt av DeepSeek med bestemte agentrammeverk, maksimal resonneringsinnsats og opptil 500 steg. Modellen er sterk på noen agentoppgaver, men tabellen dokumenterer ikke at den er best til alt. Leverandørtall er startpunktet for testing, ikke målstreken.
V4.1 Flash støtter resonneringsinnsats fra 1 til 100. Det gir utviklere en nyttig kontroll mellom kostnad og kvalitet, men gjør også sammenligninger mer krevende. En modell på maksimal innsats kan bruke langt mer tid og flere tokens enn den samme modellen med en moderat innstilling. Jeg vil se pris, svartid og løsningsgrad målt sammen på virkelige arbeidsflyter før jeg kårer noen vinner.
Åpne vekter er bra, men driften er ikke enkel
MIT-lisensen er et klart pluss. DeepSeek har dessuten publisert kode for promptformat, verktøykall, multimodal input, resonneringsinnsats og en minimal inferensimplementasjon. For produksjon viser selskapet til deepseek-recipe, et sett Rust-biblioteker med Python-bindinger som kan oversette Chat Completions- og Responses-forespørsler til modellens eget format.
Men referansekoden beskrives uttrykkelig som lesbar, ikke som en ferdig serveringsmotor. Kjøring krever konverterte sjekkpunkter og tensorparallell oppstart, mens verktøyutførelse og HTTP-transport overlates til brukeren. Dette er med andre ord en åpen modellplattform for folk som kan bygge driftslaget rundt den.
For de fleste vil en API-tjeneste være den realistiske inngangen. Før man flytter en agent, ville jeg målt fire ting i egen arbeidslast: tid til første token, cachebehov per aktiv sesjon, pris per ferdig oppgave og kvalitet etter lange forløp. Et kontekstvindu på 1 million tokens er bare verdifullt dersom systemet fortsatt finner nåla etter at noen har gitt det en høystakk.
Dette er den viktige oppgraderingen
DeepSeek V4 hadde allerede 1 million tokens, og forrige V4 Flash-utgave var allerede rettet mot agenter. V4.1 Flash gjør derfor ikke krav på oppmerksomhet bare ved å gjenta et stort kontekstvindu. Den gjør selve driften av det vinduet mer troverdig.
890 byte per token, halv encoder-decoder-splitt, FP4-cache og gjenbruk mellom lag er tekniske detaljer med en svært konkret konsekvens: mer agenthistorikk kan beholdes uten at cachekostnaden eksploderer like raskt. Det kan gi høyere tetthet og bedre økonomi i systemer der input allerede er den tyngste delen av jobben.
Jeg ville ikke flyttet produksjon til DeepSeek på bakgrunn av deres egen rapport alene. Men jeg ville absolutt testet denne arkitekturen mot en ekte, langvarig agentarbeidsflyt. V4.1 Flash viser at kampen om lange kontekster har flyttet seg fra skrytetall til minne, båndbredde og gjenbruk. Endelig.
Ofte stilte spørsmål
Hvor stor KV-cache bruker DeepSeek V4.1 Flash ved full kontekst?
Den globale KV-cachen er oppgitt til 890 byte per token. Ved 1 million tokens blir det omtrent 890 MB for én sekvens, før andre cachetyper, modellvekter og driftsdata regnes med. DeepSeek oppgir omtrent fire ganger lavere nivå enn V4 Flash.
Kan DeepSeek V4.1 Flash kjøres på en vanlig PC?
Ikke realistisk som komplett modell for folk flest. Modellen har 552 milliarder backbone-parametere og 196 milliarder Engram-parametere. Den åpne referanseimplementasjonen viser tensorparallell kjøring over åtte prosesser, men oppgir ikke et enkelt forbrukeroppsett som passer en vanlig PC.
Er DeepSeek V4.1 Flash en multimodal modell?
Ja. Modellen tar imot både bilder og tekst og genererer tekst. DeepSeek oppgir at den er trent på 45 billioner multimodale tokens, med sju deler tekst for hver del multimodale data, og at bilde- og tekstinformasjon behandles samlet.
Er 1 million tokens nyttig for alle AI-agenter?
Nei. Stor kontekst hjelper når agenten må arbeide med mye relevant historikk, kode eller dokumentasjon. Den erstatter ikke god henting og oppsummering. Mål tid til første token, cachekostnad og løsningskvalitet i egen arbeidsflyt før du fyller hele vinduet.