Innhold Vis
DeepSeek V4 Pro er lansert i app, på web og gjennom API-et, med et tydelig løft for koding og agentarbeid. Men leverandørens benchmarktabell får ikke avgjøre om modellen er god nok for jobben din. Det må modellen bevise i ekte prosjekter.
Responses API, valgbare resonneringsnivåer og bedre støtte for lange agentforløp er konkrete forbedringer. En god agentmodell må klare å holde retningen gjennom mange verktøykall, tolke resultatene og fullføre en jobb uten at du må stå ved siden av og være barnevakt. DeepSeek hevder at nettopp dette er vesentlig forbedret i produksjonsmiljøer.
Jeg er skeptisk når en modellleverandør presenterer store forbedringer før folk har fått testet dem skikkelig. Men denne lanseringen har konkrete endringer som er verdt å følge med på. Nå kan vi måle dem i praksis.
Hva er nytt i DeepSeek V4 Pro?
DeepSeek V4 Pro er gått fra preview til en offisiell GA-versjon som er rullet ut i appen, på web og i API-et. Ifølge DeepSeeks endringslogg fra 13. august beholder API-et samme kall: Modellnavnet deepseek-v4-pro peker nå på den nyeste versjonen.
GA står for «general availability», altså at dette er versjonen DeepSeek nå tilbyr som ordinær tjeneste. Det er noe annet enn preview-lanseringen i april. Da skrev jeg både om DeepSeek V4 Pro som preview-modell og om hovedmodellen med åpne vekter og én million tokens kontekst. Nå er den ferdige Pro-versjonen på plass.
DeepSeek trekker fram tre endringer: et betydelig løft i agentarbeid, innebygd støtte for OpenAI-formatet Responses API og valgbare resonneringsnivåer. Modellen kan dessuten brukes i både tenkende og ikke-tenkende modus, med et kontekstvindu på én million tokens og maksimal output på 384 000 tokens.
DeepSeek har også publisert modellvektene for DeepSeek-V4-Pro-0813 på Hugging Face under MIT-lisens. Dette er altså mer enn en tjenesteoppdatering. Lokal kjøring er mulig, men modellkortet oppgir rundt 1,7 billioner parametere og viser et oppsett med fire GB300-GPU-er. Det er ikke akkurat en modell du tilfeldig laster ned på kontor-PC-en. Er DeepSeek nytt for deg, har jeg også en grunnleggende forklaring av selskapet og modellfamilien.
Hvor stort er agentløftet?
Agentløftet er stort i DeepSeeks egne målinger, men tallene er fortsatt leverandørens resultater. Ett eksempel er 87,9 på Terminal Bench 2.1.
Det er relevante tester fordi de forsøker å måle mer enn vanlig spørsmål og svar. Terminal Bench handler om arbeid i terminalmiljøer, mens andre tester ser på kodebaser, verktøybruk og lengre agentforløp. Det er nærmere det utviklere faktisk ber en coding agent om å gjøre enn en klassisk flervalgstest.
Likevel er et agentresultat aldri bare et rent mål på modellen. Harness, systemprompt, verktøyformat, tidsgrenser, antall forsøk og hvor mye resonnering modellen får bruke, kan påvirke utfallet kraftig. Resultatene er gode nok til å gjøre V4 Pro interessant. De er ikke gode nok til å gjøre egen testing overflødig.
Det jeg ville målt, er langt mindre glamorøst: Hvor ofte fullfører modellen hele oppgaven? Hvor mange ganger må du styre den tilbake? Retter den feilen etter et mislykket verktøykall, eller går den i ring? Og hvor mye tid og penger bruker den før resultatet faktisk kan beholdes? Tallene fra en leverandør er invitasjonen. Produksjonsjobben din er dommeren.
Hvorfor betyr Responses API noe?
Responses API betyr at DeepSeek nå støtter et format som samler modellrespons, resonnering og verktøykall i en arbeidsflyt som moderne agenter allerede forstår. DeepSeek sier at støtten er innebygd og spesielt tilpasset Codex. Dermed blir det mindre behov for et hjemmelaget kompatibilitetslag mellom modellen og agentklienten.
Det betyr ikke at OpenAI leverer DeepSeek-modellen, eller at dataene går til OpenAI når du peker klienten mot DeepSeek. Modell, API-nøkkel, kapasitet, fakturering og databehandling ligger fortsatt hos DeepSeek. Responses API er grensesnittet de har valgt å støtte.
For utviklere er dette en praktisk forbedring. Det gjør det lettere å prøve samme arbeidsflyt med ulike modeller, særlig hvis klienten allerede snakker Responses-formatet. DeepSeek støtter også OpenAI Chat Completions og et Anthropic-kompatibelt endepunkt, så V4 Pro kan kobles til flere typer agentverktøy uten at hele oppsettet må bygges rundt én leverandør.
Her er det likevel lett å bli blendet av at oppsettet ser enkelt ut. Ikke slipp en ny modell løs på sensitiv kode eller produksjonshemmeligheter før du har kontrollert databehandling, logger, tilgangsrettigheter og hvilke mapper agenten kan lese. Et pent API-format er ikke en sikkerhetsvurdering.
Hva gjør low, high og max?
De tre nivåene styrer hvor mye resonneringsarbeid V4 Pro og V4 Flash skal bruke. DeepSeek anbefaler low til enkle oppgaver, high til vanlig agentarbeid og max til de mest krevende jobbene. Tenkemodus er slått på som standard.
I OpenAI-formatet settes nivået med reasoning_effort. Den offisielle veiledningen for tenkemodus sier at low faktisk gir lav innsats, mens medium, high og xhigh mappes til high. Bare max gir maksimal innsats. Les dokumentasjonen til klienten du bruker, ikke gjett ut fra navnet alene.
Dette er en fornuftig retning. En modell trenger ikke bruke maksimal tenking på å endre et variabelnavn eller forklare en kort feilmelding. Samtidig kan det være dyrt å spare resonnering når oppgaven krever planlegging på tvers av mange filer og verktøy.
Start med high på ekte agentoppgaver og mål resultatet. Prøv low på avgrensede oppgaver der det er lett å kontrollere svaret. Bruk max når oppgaven faktisk er kompleks nok til å forsvare mer tid og flere tokens. Høyeste innstilling er ikke en medalje.
Hva koster DeepSeek V4 Pro?
Fram til prisendringen koster V4 Pro 0,435 dollar per million input-tokens uten cache-treff og 0,87 dollar per million output-tokens. Med Norges Banks siste publiserte kurs 12. august på 9,4725 kroner per dollar er det cirka 4,12 kroner for input og 8,24 kroner for output. Cache-treff på input koster 0,003625 dollar, omtrent 3,4 øre per million tokens.
Fra 16. august 2026 klokken 16.00 UTC innfører DeepSeek topp- og lavlastpriser. Den offisielle pristabellen oppgir 0,66 dollar for en million input-tokens uten cache-treff og 1,98 dollar for output utenom topptid. Det tilsvarer omtrent 6,25 og 18,75 kroner.
I topptiden øker de samme prisene til 1,32 dollar for input og 3,96 dollar for output, cirka 12,50 og 37,50 kroner. Topptid er oppgitt som 01.00-04.00 og 06.00-10.00 UTC. Resten av døgnet får halv pris. For norsk sommertid betyr det omtrent 03.00-06.00 og 08.00-12.00.
Det er fortsatt lave tokenpriser sammenlignet med mange toppmodeller, men endringen er betydelig. Prisen for V4 Pro-output blir mer enn firedoblet fra dagens 0,87 dollar til 3,96 dollar i topptiden. Har du batchjobber som kan flyttes, bør du legge dem utenfor de dyre timene. Har du en interaktiv tjeneste, må du regne med toppprisen i budsjettet.
Tokenpris alene forteller heller ikke hva agentjobben koster. En billig modell som bruker tre forsøk, skriver enorme resonneringsspor eller må få oppgaven rettet flere ganger kan bli dyrere enn en modell med høyere pris per token. Mål kostnad per ferdig jobb.
Er V4 Pro bedre enn V4 Flash?
V4 Pro er toppvarianten for krevende resonnering og agentarbeid, mens V4 Flash er laget for høyere kapasitet og lavere pris. Pro har en samtidighetsgrense på 500 kall per konto, mot 2 500 for Flash. Begge støtter én million tokens kontekst, opptil 384 000 tokens output og de tre nye innsatsnivåene.
Den praktiske forskjellen er derfor ikke bare «best» mot «nest best». Flash kan være riktig til mange raske og tydelig avgrensede oppgaver, mens Pro bør få de jobbene der feil, lange planer og komplisert verktøybruk koster mer enn modellkallet. Jeg skrev nylig om agentløftet i DeepSeek V4 Flash, og den modellen forsvinner ikke fordi Pro nå er offisiell.
V4 Pro bygger på en enorm Mixture-of-Experts-arkitektur. Modellkortet på Hugging Face oppgir rundt 1,7 billioner parametere totalt. Arkitekturen og stabilitetsmekanismene er grundigere forklart i artikkelen min om DeepSeek V4-rapporten. Den størrelsen gjør lokal kjøring til en helt annen øvelse enn å velge modellen i et API.
Jeg ville startet med en liten testpakke fra egen arbeidshverdag: noen korte endringer, én vanskelig feil og én lengre agentjobb med flere verktøykall. Kjør samme oppgaver med Flash og Pro, logg tokens, tidsbruk, avbrudd og hvor mye manuelt arbeid som gjenstår. Da får du et svar som faktisk er nyttig.
DeepSeek må bevise dette i ekte prosjekter
DeepSeek V4 Pro er nå en reell GA-lansering, ikke et rykte eller en «kommer snart»-melding. App, web og API er oppdatert, og modellvektene er publisert. Responses API, valgbart resonneringsnivå og bedre agentstøtte gjør modellen mer praktisk for utviklere enn den var som preview.
Det er den gode nyheten. Den nøkterne delen er at DeepSeeks egne benchmarkresultater fortsatt er DeepSeeks egne benchmarkresultater. De viser hva selskapet mener modellen kan gjøre under deres oppsett. De viser ikke automatisk hvor godt den håndterer kodebasen din, verktøyene dine og de rare feilene som bare dukker opp fredag ettermiddag.
Så ja, test den. Bruk high som et fornuftig utgangspunkt, gi den en ordentlig agentoppgave og mål hele leveransen. Sammenlign Pro med Flash, planlegg flyttbare API-jobber utenfor topptid og behold et kritisk blikk. Hvis produksjonsgevinsten er like sterk som DeepSeek hevder, kommer det til å synes uten at vi trenger å forelske oss i en benchmarktabell.
Ofte stilte spørsmål
Er DeepSeek V4 Pro tilgjengelig nå?
Ja. Den offisielle GA-versjonen ble rullet ut 13. august 2026 i DeepSeek-appen, på web og gjennom API-et. Modellvektene for DeepSeek-V4-Pro-0813 er også publisert. Eksisterende API-integrasjoner kan bruke modellnavnet deepseek-v4-pro.
Kan DeepSeek V4 Pro brukes med Codex?
Ja. DeepSeek har lagt inn støtte for OpenAI-formatet Responses API og sier integrasjonen er tilpasset Codex. Du bruker fortsatt DeepSeeks endepunkt, API-nøkkel og fakturering, så dette er kompatibilitet med klienten – ikke en OpenAI-tjeneste.
Når blir DeepSeek V4 Pro dyrere?
De nye topp- og lavlastprisene gjelder fra 16. august 2026 klokken 16.00 UTC. Utenom topptid koster output 1,98 dollar per million tokens, cirka 18,75 kroner. I topptiden dobles prisen til 3,96 dollar, omtrent 37,50 kroner.
Bør jeg velge V4 Pro eller V4 Flash?
Velg Pro til krevende resonnering og lange agentoppgaver, og test Flash på raske eller tydelig avgrensede jobber. Sammenlign kostnad per ferdig resultat, ikke bare pris per token. Begge modellene støtter én million tokens kontekst og opptil 384 000 tokens output.