Innhold Vis
Hvis du ventet på Googles neste toppmodell til koding, agenter og krevende kunnskapsarbeid, har den endelig fått navn: Gemini 4 Argon. Den dårlige nyheten er at du sannsynligvis ikke får bruke den ennå. Google gir den første tilgangen til et utvalg godkjente cyberforsvarere, mens utviklere, bedrifter og vanlige brukere må vente.
Dette er derfor en kunngjøring med en ganske stor stjerne i margen. Google viser fram en modell som skal kunne holde det gående gjennom svært lange arbeidsløp, generere opptil én million output-tokens og finne, kontrollere og reparere alvorlige sårbarheter. Men selskapet har ikke gitt noen dato for vanlig tilgang. The Verge omtalte lanseringen 30. september 2026, samme dag som Google presenterte modellen.
Det mest interessante er ikke at Google har laget enda en pen tabell der selskapet gjør det bra. Det er kombinasjonen av lange agentløp, konkrete interne arbeidsresultater og en modell som Google mener er kraftig nok til å kreve trinnvis utrulling. Hvis dette holder utenfor Googles egne tester, kan Argon bli langt mer enn en litt bedre chatbot. Foreløpig er den likevel et løfte bak en låst dør.
Hva er Gemini 4 Argon?
Gemini 4 Argon er Googles nye frontiermodell for langvarige og sammensatte arbeidsoppgaver innen programvareutvikling, juridisk og finansielt kunnskapsarbeid og cybersikkerhet. Google annonserte modellen 30. september 2026 og gir i første omgang tilgang til et begrenset utvalg cyberforsvarere gjennom Fairwind-programmet.
Argon er altså ikke bare en modell for spørsmål og svar. Den er laget for arbeidsflyter der modellen må planlegge, bruke verktøy, undersøke resultater og fortsette gjennom mange steg. Det er samme retning hele bransjen beveger seg i: Modellen skal ikke bare foreslå neste handling, men faktisk gjøre en større del av jobben.
Google trekker særlig fram koding, research, juridisk arbeid, finans og reparasjon av programvaresårbarheter. Selskapet sier også at modellen har sterk multimodal forståelse og kan arbeide med blant annet dokumentserier, diagrammer og lange videoer. Det passer inn i utviklingen jeg tidligere har beskrevet i den norske oversikten over Gemini-plattformen: Gemini er blitt en hel verktøykasse, ikke én enkelt chatbot.
Hvorfor betyr én million output-tokens noe?
Én million output-tokens betyr at Argon kan produsere langt mer i ett sammenhengende arbeidsløp enn tidligere Gemini-modeller. Google oppgir at grensen er økt fra 64 000 til én million tokens. Det er en output-grense, ikke nødvendigvis et løfte om én million tokens med nyttig tekst hver gang og ikke det samme som modellens kontekstvindu.
Forskjellen er viktig. Kontekstvinduet avgjør hvor mye modellen kan ha med seg inn i arbeidet. Output-grensen avgjør hvor mye den kan generere underveis. En høy output-grense gir mer spillerom til lange agentløp, omfattende kodeendringer og oppgaver der modellen må prøve, feile, kontrollere og rette uten at hele kjeden kuttes av etter noen titusen tokens.
Én million tokens kan samtidig bli både dyrt og rotete. Mer plass gjør ikke automatisk tankegangen bedre. En agent som går feil i steg 12, kan bruke de neste hundre tusen tokenene på å grave et svært imponerende hull. Det avgjørende blir derfor om Argon kan holde retningen, bruke verktøy riktig og stoppe når jobben faktisk er ferdig.
Google hevder at modellen nettopp er sterk på slike lange forløp. På GraphWalks oppgir selskapet en F1-score på 84,2 prosent for oppgaver mellom 256 000 og én million tokens. Det sier noe om evnen til å følge strukturer over lang avstand, men det er fortsatt et leverandørresultat. Ekte kodebaser og bedriftsprosesser har en lei tendens til å være mindre ryddige enn en benchmark.
Hva har Google faktisk brukt Argon til?
Google sier at tusenvis av egne ansatte allerede har brukt Argon til spesialisert koding, dypere research og skrivearbeid. De mest interessante eksemplene er konkrete: Agenter skal ha analysert ytelsesdata på tvers av Googles datasentre og frigjort mer enn 300 TiB minne, med en anslått samlet besparelse på mellom 500 TiB og 1 PiB.
Modellen brukes også i store migreringer fra C og C++ til Rust. Omfanget strekker seg ifølge Googles egen lanseringsartikkel fra biblioteker med noen titusen linjer til mer enn 800 000 linjer i Zircon-kjernen til Fuchsia. Google understreker at endringene går gjennom automatiske og manuelle kontroller før produksjon. Det bør de også. Ingen fornuftig utvikler slipper en agent løs på en operativsystemkjerne og håper på det beste.
I videodekoderen libgav1 skal Argon-agenter ha erstattet 32 000 linjer SIMD-kode i en Rust-port. Resultatet kjørte 2,7 ganger raskere enn den tidligere Rust-versjonen, med identisk videoutdata og ytelse nær den optimaliserte C++-koden. Google hevder dessuten at Argon forbedret en publisert referanse for en kvantealgoritme med 40 prosent på få minutter.
Dette er langt mer interessant enn en generell påstand om at modellen er smartere. Samtidig er det Google som har valgt oppgavene, kjørt systemet og presentert resultatene. Vi mangler fortsatt detaljene som trengs for å vite hvor mye menneskelig arbeid, hvor mange forsøk og hvor stort tokenbudsjett som lå bak.
Er Gemini 4 Argon bedre enn GPT og Claude?
Googles egne målinger plasserer Argon helt i front på flere tester, men ikke på alle. Modellen får 77,9 prosent på DeepSWE v1.1 for langvarig programvarearbeid, 51,3 prosent på AutomationBench og 68,9 prosent på Vals Index for kunnskapsarbeid. På CWE-bench v1 for reparasjon av sårbarheter deler den førsteplassen med GPT-6 Astra på 68 prosent.
På andre tester ligger konkurrentene foran. Argon får 55,0 prosent på FrontierSWE v2, mot 65,5 for GPT-6 Astra og 62,3 for Claude Opus 5.5 i Googles tabell. På Terminal-bench 4.0 får Argon 57,4 prosent, mens Opus 5.5 står med 66,4. Dette ser altså ut som en svært sterk og bred modell, ikke en magisk vinner av absolutt alt.
Googles modelltabell viser en bred sammenligning på tvers av koding, kunnskapsarbeid, vitenskap, lang kontekst, databruk og multimodal forståelse. Resultatene gir et nyttig første bilde, men leverandørtabeller er startpunktet for testing, ikke slutten på diskusjonen. Harness, verktøy, tenkebudsjett og antall forsøk kan flytte agentresultater mye.
Den praktiske dommen må derfor vente til uavhengige utviklere får tilgang. Klarer Argon store kodeendringer uten å rote til nabomoduler? Holder den avtaler og begrensninger gjennom et langt oppdrag? Hvor ofte må et menneske gripe inn? Det er slike spørsmål som avgjør om modellen sparer arbeid eller bare produserer mer av det.
Hvorfor får cyberforsvarere tilgang først?
Cyberforsvarere får tilgang først fordi Google mener Argon har avanserte egenskaper for å finne, validere og reparere kritiske programvaresårbarheter. For utvalgte forsvarere og Googles egne team leveres modellen uten de vanlige cyberbegrensningene, slik at de kan bruke hele kapasiteten i defensive oppgaver.
Tilgangen går gjennom Googles Fairwind-program, som ble lansert i september. Programmet omfatter mer enn 650 partnere globalt, blant annet myndigheter, operatører av kritisk infrastruktur og sentrale teknologiplattformer. Det betyr ikke at alle 650 automatisk får Argon. Google beskriver utrullingen som et første utvalg av betrodde cyberforsvarere. Jeg skrev nylig mer om hvordan Fairwind gir cyberforsvarere tidlig tilgang til Googles modeller og verktøy.
Wiz er den eneste eksterne Argon-brukeren Google navngir i lanseringen. Gjennom initiativet Scan for Good skal modellen ha funnet en alvorlig sårbarhet som eksponerte sensitive personopplysninger i programvare brukt av sykehus. Google sier tidligere frontiermodeller hadde oversett feilen. Det er et lovende eksempel, men selskapet publiserer ikke nok tekniske detaljer til at påstanden kan kontrolleres uavhengig nå.
Google jobber samtidig med fire sikkerhetsområder før bred tilgang: misbruk innen cyber og farlige vitenskapsområder, indirekte prompt injection, overvåking av handlinger som går utenfor brukerens hensikt og hardere isolering av testmiljøene. Selskapet deltar også i den amerikanske regjeringens frivillige prosess for tilgang før lansering. Det er selskapets forklaring på den lukkede døren. For resten av oss betyr det ganske enkelt at modellen ikke er ferdig tilgjengelig.
Når kommer Gemini 4 Argon, og hva vil den koste?
Google har ikke oppgitt en dato for bred tilgang. Selskapet sier at utviklere, bedrifter og forbrukere skal få modellen så snart det er mulig, med betalende API-kunder og Google AI Ultra-abonnenter først i køen. Det finnes foreløpig ingen offentlig modell-ID eller vanlig API-dokumentasjon som gjør Argon til et reelt produksjonsvalg.
Introduksjonsprisen blir 2 dollar per million input-tokens og 10 dollar per million output-tokens. Med Norges Banks publiserte dollarkurs på 9,6006 kroner 30. september tilsvarer det omtrent 19 kroner for input og 96 kroner for output per million tokens. Cachet input skal koste 95 prosent mindre, altså rundt én krone per million tokens. Norges Bank beskriver kursene som veiledende midtkurser, så den faktiske kort- eller bankkursen vil avvike litt.
Etter introduksjonsperioden dobles prisene til 4 dollar og 20 dollar, cirka 38 og 192 kroner per million tokens med samme kurs. Google har ikke oppgitt når introduksjonsperioden slutter. Prisen kan være konkurransedyktig for en modell i denne klassen, men et arbeidsløp som faktisk bruker én million output-tokens vil koste omtrent 96 kroner i introduksjonsperioden og 192 kroner senere, før input og nye forsøk. En dårlig avgrenset agent kan derfor svi av mer enn prisen per enkeltkall først får det til å se ut som.
Det er verdt å huske når man leser «én million tokens» som et rent kapasitetsløfte. Et langt arbeidsløp må ha budsjettgrenser, stoppkriterier og kontrollpunkter. Ellers kan stor kapasitet fort bli en svært grundig måte å gjøre feil på.
Hva bør utviklere og bedrifter gjøre nå?
Ikke bygg produksjonsplanen rundt Gemini 4 Argon ennå. Vent til Google publiserer modell-ID, API-dokumentasjon, regionale vilkår, rate limits og en faktisk dato. Kunngjøringen er viktig, men en modell du ikke kan kalle, teste eller kostnadsberegne i eget miljø er ikke en del av verktøykassen.
Det du kan gjøre nå, er å forberede gode evalueringsoppgaver. Velg noen virkelige kodeendringer, researchoppdrag eller dokumentprosesser der du allerede kjenner fasiten, tidsbruken og risikoen. Mål hele leveransen: antall forsøk, verktøykall, menneskelig opprydding, tokenbruk og feil som slapp gjennom. Ikke bare om modellen klarte benchmarken Google valgte.
Jeg ville også startet med begrenset tilgang til filer, nettverk og produksjonssystemer. En modell laget for å fortsette lenge og handle selvstendig trenger tydelige rammer. Store kontekstvinduer og lange outputgrenser erstatter ikke god tilgangskontroll. De gjør bare agenten i stand til å gjøre mer før noen stopper den.
Gemini 4 Argon ser på papiret ut som Googles mest ambisiøse modell for ekte arbeid til nå. Den kan også styrke bildet av Google som en stadig mer komplett AI-leverandør, noe jeg tidligere skrev om da Gemini 3 flyttet konkurransen i Googles retning. Men den endelige dommen kommer ikke fra Googles tabell. Den kommer når folk utenfor Google får modellen i hendene og ser om den faktisk fullfører jobben.
Ofte stilte spørsmål
Kan vanlige brukere prøve Gemini 4 Argon nå?
Nei. Per 1. oktober 2026 er tilgangen begrenset til et første utvalg cyberforsvarere og betrodde testere. Google sier at betalende API-kunder og Google AI Ultra-abonnenter skal stå først når tilgangen utvides, men har ikke oppgitt noen dato.
Er én million tokens kontekst eller output?
Google beskriver én million tokens som modellens output-grense. Det er hvor mye Argon kan generere i ett arbeidsløp, ikke en bekreftelse på at kontekstvinduet har samme størrelse. De to grensene må ikke blandes sammen.
Hva skal Gemini 4 Argon koste i API-et?
Introduksjonsprisen blir 2 dollar per million input-tokens og 10 dollar per million output-tokens, omtrent 19 og 96 kroner med kursen 30. september 2026. Senere dobles prisene til 4 og 20 dollar, men Google har ikke oppgitt når.
Er Gemini 4 Argon bedre enn GPT-6 Astra og Claude Opus 5.5?
Argon leder flere av testene i Googles sammenligning, men taper andre, blant annet FrontierSWE v2 og Terminal-bench 4.0. Leverandørtallene viser en sterk modell, men uavhengige tester og praktisk bruk må til før det går an å kåre en klar vinner.