Hvis du følger med på AI-agenter, er DeepSeek Harness viktigere enn enda en modell som svarer litt bedre i en benchmark. DeepSeek har begynt å hente inn utviklere til testing av programvarelaget som skal la modellene arbeide gjennom en oppgave, bruke verktøy og rette egne feil.

DeepSeek inviterer foreløpig til en lukket test, ikke en ferdig lansering. DeepSeek har ikke lagt ut noen offentlig funksjonsliste, kodebase, lisens eller lanseringsdato. Det betyr at vi vet mer om hvorfor selskapet bygger Harness enn om hvor godt produktet faktisk virker.

Likevel treffer prosjektet en viktig endring i AI-markedet. Modellen er ikke lenger hele produktet. Det er laget rundt modellen som avgjør om den bare kan foreslå en kommando, eller faktisk holde orden på filer, kjøre kommandoen, lese feilmeldingen og prøve igjen. Det er også der DeepSeek kan gjøre sin lave modellpris langt mer verdifull.

Hva er DeepSeek Harness?

DeepSeek Harness er et programvarelag som skal gjøre en språkmodell om til en agent som kan utføre flertrinnsoppgaver. Shifter meldte 5. august at DeepSeek rekrutterer utviklere fra open source-miljøet til testing, men selskapet har ennå ikke oppgitt når verktøyet blir tilgjengelig for alle.

Ordet harness kan høres ut som enda et navn tech-bransjen har funnet på for å gjøre noe enkelt vanskelig. I praksis er det styringssystemet rundt modellen. Det gir modellen tilgang til for eksempel filer, terminal, søk og andre verktøy, og bestemmer hvordan resultatene skal sendes tilbake til modellen.

En vanlig chatbot kan skrive at du bør endre tre filer. En coding agent må finne filene, forstå prosjektreglene, gjøre endringene, kjøre testene og håndtere det som feiler. Da holder det ikke at modellen er flink til å produsere kode i ett svar. Den må få riktig kontekst og riktige verktøy gjennom mange steg uten å miste oppgaven underveis.

DeepSeek beskriver tanken enkelt: modell pluss harness blir en agent. Det er en nyttig forenkling, men den peker også på ansvarsdelingen. Modellen leverer resonnering og språk. Harness håndterer arbeidsmiljø, verktøy, historikk, tillatelser og kontrollsløyfen som lar modellen fortsette til jobben er ferdig.

Styringslaget kobler AI-modellen til verktøy, arbeidsminne, tillatelser og kontrollsløyfer gjennom flere steg
Et harness gir modellen verktøy, kontekst og kontrollsløyfen som trengs for å utføre flertrinnsoppgaver.

Hvorfor er laget rundt modellen så viktig?

Laget rundt modellen er viktig fordi en agent må gjøre mange små valg som en vanlig chatbot slipper. Den må velge verktøy, tolke resultatet, oppdatere planen og avgjøre når oppgaven faktisk er løst. En god modell i et dårlig harness kan derfor levere svakere enn en rimeligere modell i et gjennomtenkt system.

Det forklarer også hvorfor de store AI-selskapene ikke bare konkurrerer om modellkvalitet. Claude Code, Codex og andre agentverktøy selger en hel arbeidsflyt. Kunden betaler ikke bare for tokens, men for at systemet skal forstå kodebasen, beskytte arbeidsmiljøet og få noe ferdig med minst mulig håndholding.

Jeg liker modeller som kan jobbe agentisk, men det er fort gjort å overvurdere modellen og undervurdere resten. Agenten trenger gode regler, avgrensede tillatelser, fornuftig konteksthåndtering og en måte å kontrollere resultatet på. Uten det har du ikke fått en digital arbeidstaker. Du har gitt en chatbot tilgang til terminalen. Det er ikke helt det samme.

Dette er også grunnen til at DeepSeeks egne målinger må leses med et lite forbehold. Da selskapet oppdaterte V4 Flash 31. juli, oppga det blant annet 82,7 på Terminal Bench 2.1 og 54,4 på DeepSWE. I den offisielle endringsloggen står det samtidig at kodeagent-testene ble kjørt med DeepSeek Harness i en forenklet minimalmodus som ennå ikke er utgitt.

Hva vet vi faktisk om den lukkede testen?

Vi vet at DeepSeek har startet rekrutteringen av testere, men ikke hvor mange som får tilgang eller nøyaktig hva de skal prøve. Deltakerne skal velges til en lukket betatest. Det er dermed for tidlig å si om Harness først og fremst blir et coding-verktøy, en mer generell agentplattform eller begge deler.

Arbeidet ledes av Cui Tianyi, som kom til DeepSeek i mars 2026 for å bygge Harness-teamet. South China Morning Post beskrev i juni hvordan teamet rekrutterte for å gjøre grunnmodellene om til autonome produkter. Testfasen viser at prosjektet har beveget seg videre fra stillingsannonser og planer.

Det vi ikke vet, er minst like viktig. DeepSeek har ikke bekreftet hvilke operativsystemer eller verktøy som støttes, hvordan sikkerheten håndteres, eller om løsningen kan bruke andre modeller enn DeepSeeks egne. Det finnes heller ingen offentlig dokumentasjon på installasjon, datalagring eller bruk i bedrifter.

Shifter omtaler kombinasjonen som et gratis og åpent agentlag, men det bør ikke behandles som et ferdig produktløfte før DeepSeek har publisert kode og lisens. Å invitere folk fra open source-miljøet til en lukket test er ikke det samme som å publisere hele agentlaget som open source. Akkurat den forskjellen kan avgjøre om dette blir et felles verktøy eller bare en effektiv salgskanal for DeepSeek-API-et.

Den lave prisen kan endre regnestykket

DeepSeek V4 Flash koster 0,14 dollar per million nye input-tokens og 0,28 dollar per million output-tokens. Med Norges Banks dollarkurs på 9,5462 kroner 4. august blir det cirka 1,34 kroner inn og 2,67 kroner ut per million tokens. DeepSeeks pristabell oppgir dessuten 0,0028 dollar, rundt 3 øre, for en million input-tokens som allerede finnes i hurtigbufferen. DeepSeek varsler samtidig at prisene senere skal dobles i bestemte kinesiske rushtidsvinduer, men har ikke oppgitt når ordningen starter.

Det siste tallet er spesielt interessant for agenter. En coding agent sender ofte mye av den samme prosjektkonteksten om igjen mens den arbeider. Hvis Harness er bygget for å gi høy treffrate i hurtigbufferen, kan kostnaden bli svært lav selv når en oppgave krever mange runder.

Billige tokens løser likevel ikke alt. En agent som bruker tre ganger så mange steg, velger feil filer eller må få oppgaven kjørt på nytt, kan bli dyr i arbeidstid selv om API-regningen nesten forsvinner. Den riktige målingen er derfor ikke pris per million tokens alene. Det er pris per oppgave som er riktig utført og kontrollert.

Her ligger den virkelige muligheten for DeepSeek. Hvis selskapet kan kombinere en svært rimelig modell med et agentlag som er laget spesielt for modellens sterke og svake sider, utfordrer det langt mer enn modellprisene. Da konkurrerer DeepSeek om hele arbeidsflyten som utviklere i dag kjøper fra amerikanske leverandører.

Billige AI-tokens går gjennom hurtigbuffer og agentsteg mot en fullført oppgave
Lav tokenpris hjelper bare når agenten bruker stegene effektivt og leverer en korrekt, kontrollert oppgave.

Kan DeepSeek Harness brukes uten DeepSeek?

Det er ikke bekreftet om DeepSeek Harness vil støtte modeller fra andre leverandører. En åpen og modellnøytral løsning ville vært mest interessant for utviklere, mens en tett kobling til V4 Flash og V4 Pro ville gitt DeepSeek bedre kontroll over opplevelsen og mer API-bruk.

DeepSeek har allerede gjort modellene lettere å bruke i eksisterende systemer. V4 Flash støtter Responses API-formatet og er tilpasset Codex-klienter, mens både Flash og Pro kan brukes gjennom OpenAI- og Anthropic-kompatible grensesnitt. Det tyder på at selskapet forstår verdien av å passe inn i verktøyene utviklerne allerede har.

Samtidig er et eget harness en mulighet til å optimalisere hele sløyfen for DeepSeeks modeller. Systemprompt, verktøyformat, kontekstpakking og hurtigbuffer kan tilpasses nøyaktig slik modellen fungerer best. Det kan forklare hvorfor DeepSeek fikk sterke resultater med sitt eget oppsett, mens erfaringene i andre agentverktøy spriker mer.

For brukeren er modellfrihet verdifullt fordi én modell sjelden er best til alt. Jeg bruker flere modeller til ulike oppgaver, og jeg liker særlig Grok-modellene til koding. Et harness som låser hele arbeidsflyten til én leverandør må derfor være merkbart bedre eller billigere for å forsvare låsen.

Hva bør bedrifter og utviklere følge med på?

Det viktigste er ikke en ny poengsum, men om Harness reduserer behovet for menneskelig opprydding. Følg med på hvor ofte agenten fullfører ekte oppgaver, hvor mange steg den bruker, hvordan den ber om tillatelse og om resultatet kan kontrolleres før endringer blir permanente.

Databehandling blir også avgjørende. Jeg er skeptisk til kinesiske modeller når kildekode, kundedata eller interne dokumenter skal sendes til en ekstern tjeneste. En lav pris endrer ikke hvem som behandler dataene. Bedrifter trenger klare vilkår for lagring, trening, sletting og hvor trafikken behandles før dette går inn i en produksjonsflyt.

Se også etter sandboxing og grenser for hvilke handlinger agenten kan utføre. En agent bør ikke få bredere tilgang enn oppgaven krever. Den bør vise hva den har gjort, stoppe ved usikkerhet og gjøre det mulig å rulle tilbake endringer. Den kjedelige kontrollmekanikken er ikke like morsom som en imponerende demo, men det er den som avgjør om verktøyet kan få ansvar.

Jeg har tidligere skrevet en grundig forklaring av DeepSeek og om V4-previewen som utfordret Claude og GPT. Harness er en annen type milepæl. Nå handler det mindre om hva modellen kan svare, og mer om hva DeepSeek kan få den til å levere som et system.

Dette er testen DeepSeek egentlig må bestå

DeepSeek Harness er interessant fordi det flytter konkurransen fra modell til ferdig arbeid. Selskapet har allerede en modell med svært lav API-pris og egne lovende agentmålinger. Nå må DeepSeek vise at målingene kan bli til et verktøy som fungerer utenfor laboratoriets eget testoppsett.

Det er foreløpig ingen grunn til å avskrive Claude Code, Codex eller de åpne agentverktøyene. Vi har ennå ikke sett Harness i offentlig bruk. Vi vet ikke om det blir åpent, modellnøytralt eller godt nok til å håndtere store prosjekter over tid.

Men retningen er riktig. Den neste store prisrunden i AI handler neppe bare om hvem som selger den billigste modellen. Den handler om hvem som kan gjøre billige tokens om til pålitelig arbeid. DeepSeek har åpnet døren på gløtt. Nå gjenstår den delen som faktisk teller: at noen utenfor DeepSeek får prøve, måle og fortelle hva som skjer når agenten møter virkeligheten.

Ofte stilte spørsmål

Når blir DeepSeek Harness tilgjengelig for alle?

DeepSeek har ikke oppgitt noen offentlig lanseringsdato. Verktøyet er i en lukket testfase med utvalgte utviklere. Før en lansering vet vi heller ikke sikkert hvilke plattformer, funksjoner eller lisensvilkår som følger med.

Er DeepSeek Harness open source?

Det er ikke bekreftet med publisert kode og lisens. DeepSeek rekrutterer testere fra open source-miljøet, men en lukket betatest er ikke det samme som en open source-lansering. Vent på kodebasen og lisensen før du bygger planer rundt det.

Hva er forskjellen på en AI-modell og et harness?

Modellen lager resonnering, tekst og kode. Et harness gir den verktøy, filer, terminaltilgang, arbeidsminne og en kontrollsløyfe som lar den utføre flere steg. Modellen er dermed én del av agenten, ikke hele produktet.

Hvor billig er DeepSeek V4 Flash for agentarbeid?

DeepSeek tar 0,14 dollar per million nye input-tokens og 0,28 dollar per million output-tokens, cirka 1,34 og 2,67 kroner med Norges Banks kurs 4. august. Den totale kostnaden avhenger likevel av antall steg, hurtigbuffertreff og hvor ofte arbeidet må gjøres om.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre vurderer Claude pris for Free, Pro og Max i 2026

Hva koster Claude AI? Priser for Free, Pro og Max i 2026

Hva koster Claude AI i 2026? Se priser for Free, Pro, Max, Team og API i norske kroner, forstå bruksgrensene og velg planen som passer behovet ditt best.
Jan Sverre utforsker hvordan man kan lage sang med AI i Suno

Lage sang med AI: Det jeg lærte av 150 Suno-låter

Lage sang med AI på norsk: Dette lærte jeg av 150 Suno-låter om tekst, prompts, uttale, pris, gratisbruk og rettigheter før du publiserer din egen musikk.
Jan Sverre med headphones og lydmikser i boardroom-møte med forvirrede executives

Suno AI Copyright 2026 – Opphavsrett og Rettigheter for AI-Musikk

Kan du tjene penger på Suno-musikk? Her er en praktisk gjennomgang av rettigheter, risiko og hva du bør avklare før publisering.
Jan Sverre blar gjennom en tilpasset YouTube AI-videofeed på telefonen

YouTube lar deg lage din egen AI-videofeed – slik fungerer det

YouTube lar deg nå beskrive hva du vil se med vanlig tekst, og AI setter opp en personlig feed for deg. Her er hva du trenger å vite – og hva det egentlig betyr for deg som bruker.