Innhold Vis
Gemini 3.8 Flash lover bedre resonnering og mer pålitelige AI-agenter, men den like tokenprisen betyr ikke nødvendigvis samme regning. Google har laget modellen for å ta flere resonneringssteg, bruke verktøy flere ganger og kontrollere arbeidet underveis. Det kan gi bedre resultater på vanskelige oppgaver. Det kan også gi høyere tokenforbruk.
Det er den viktige detaljen bak lanseringen 2. september 2026. Gemini 3.8 Flash koster foreløpig det samme per million token som Gemini 3.7 Flash, og Google markedsfører fortsatt Flash som rask og rimelig. The Verge pekte på prisparadokset: En modell kan ha uendret stykkpris og likevel koste mer per oppgave når den bruker flere av de enhetene du betaler for.
For deg som bare bruker Gemini-appen, er dette mest en forklaring på hvorfor et krevende svar kan ta mer tid. For deg som bygger med Gemini API, kjører kodeagenter eller automatiserer arbeidsflyter, er det et budsjettspørsmål. Min korte vurdering er derfor enkel: Gemini 3.8 Flash ser lovende ut for krevende agentarbeid, men ikke flytt produksjon bare fordi prislisten ser lik ut. Mål kostnaden per fullført oppgave først.
Hva er Gemini 3.8 Flash?
Gemini 3.8 Flash er Googles nye produksjonsklare Flash-modell for langvarig programvarearbeid, autonome agenter og kompliserte arbeidsflyter. Den ble lansert bare tre uker etter 3.7 Flash og er Googles tredje Flash-utgivelse på seks uker, ifølge den offisielle lanseringen. Tempoet blir enda tydeligere når jeg ser det opp mot Gemini 3.5 Flash, som kom i mai.
Modell-ID-en i API-et er gemini-3.8-flash. Den har et kontekstvindu på opptil 1 million token, kan levere opptil 64 000 output-token og tar imot tekst, bilder, video, lyd og PDF. Output er tekst. Den støtter også function calling, søk som verktøy og computer use i preview.
Dette er med andre ord ikke en «lite»-modell for enkle sammendrag. Google posisjonerer 3.8 Flash som en arbeidshest for oppgaver som varer lenge og krever flere handlinger. Det er et annet mål enn bare å svare raskt på ett spørsmål. Den skal planlegge, bruke verktøy, se om resultatet holder og prøve videre når jobben krever det. Vil du ha hele produktfamilien i sammenheng, har jeg en egen norsk guide til Google Gemini.
Gemini 3.8 Flash blir også standardmodell i Googles Antigravity-agent og SDK. Den er tilgjengelig i Gemini API, Google AI Studio og Gemini Enterprise. For vanlige brukere rulles den ut til Google AI Pro og Ultra i Gemini-appen, AI Mode i Google Search og Gemini i Google Sheets.
Hvorfor kan samme tokenpris gi en høyere regning?
Regningen bestemmes av både pris per token og antallet token modellen bruker. Gemini 3.8 Flash beholder introduksjonsprisen på 0,75 dollar per million input-token og 3,75 dollar per million output-token til 31. desember 2026. Med en dollarkurs på omtrent 9,34 kroner er det cirka 7 kroner inn og 35 kroner ut per million token. Det er fortsatt høyere enn den opprinnelige API-prisen på Gemini 3 Flash, men langt under de dyreste frontiermodellene.
Haken er at resonneringstoken inngår i output-prisen. Når modellen tar flere interne steg på en vanskelig oppgave, er de en del av forbruket du betaler for, selv om sluttresultatet på skjermen ikke nødvendigvis er lengre. Google sier selv at 3.8 Flash kan bruke flere token på lange og kompliserte oppgaver for å kontrollere arbeidet grundigere.
Et enkelt regneeksempel viser forskjellen. Hvis en serie oppgaver bruker 1 million fakturerte output-token med 3.7 Flash, koster den omtrent 35 kroner med dagens introduksjonspris. Bruker 3.8 Flash hypotetisk 1,5 millioner token på de samme oppgavene, blir prisen rundt 52,50 kroner. Stykkprisen er identisk. Jobben er 50 prosent dyrere.
Google har ikke oppgitt en fast prosent for hvor mye mer 3.8 Flash bruker. Det ville heller ikke vært særlig nyttig, fordi forskjellen vil avhenge av prompten, verktøyene, antall runder og valgt resonneringsnivå. Poenget er ikke at modellen alltid blir dyrere. Poenget er at «samme pris» ikke forteller deg hva en fullført jobb faktisk koster.
Hva betyr «jobber hardere» i praksis?
Google bruker uttrykket om tre konkrete ting: Modellen tar flere, mindre resonneringssteg, kaller verktøy iterativt og verifiserer arbeidet underveis. Det er akkurat den arbeidsmåten som trengs når en agent skal endre flere filer, kjøre tester, lese feilmeldinger og rette det som fortsatt er galt.
En enkel chatbot kan ofte svare i ett pass. En agent må holde styr på en kjede av beslutninger. Den kan søke etter en fil, gjøre en endring, kjøre en test, oppdage at testen feiler, undersøke årsaken og prøve på nytt. Hvert ekstra steg kan øke sjansen for at resultatet faktisk virker, men det bruker også tid, verktøykall og token.
Det er derfor denne modellen er mer interessant for agentarbeid enn for vanlig småprat. Google hevder tydelige forbedringer innen flerfils refaktorering, langsiktig programvarearbeid og kompliserte fagoppgaver. Selskapet viser blant annet til 54,9 prosent på HLE-Verified, men slike benchmark-tall er ikke nok til å vite om din kodebase blir billigere eller mer pålitelig.
Den praktiske testen er om flere token gir færre mislykkede løkker, mindre etterarbeid og flere oppgaver som blir riktige på første ordentlige forsøk. En dyrere kjøring kan være billigere totalt hvis den erstatter tre mislykkede kjøringer og en halvtime med opprydding. Men det motsatte kan også skje: Modellen kan tenke lenge på noe en enklere modell løser godt nok med en gang.
Du kan styre hvor mye modellen tenker
Gemini 3.8 Flash støtter tre nivåer for thinking_level: low, medium og high. medium er standard. Googles utviklerdokumentasjon anbefaler lavt nivå for oppgaver der ventetid er viktig, medium for de fleste komplekse kode- og agentoppgaver og høyt nivå for dyp resonnering, matematikk og vanskelige oppgaver med mange steg.
Det gir deg en nyttig kostnadsknapp. Bruk low til klassifisering, korte utkast, enkel dataanalyse og hendelser som må besvares raskt. La medium være utgangspunktet for kode og agenter. Reserver high til oppgaver der feil er dyrere enn ekstra token.
minimal støttes ikke. Sender du dette nivået til Gemini 3.8 Flash, returnerer API-et en feil. Ved migrering må du også erstatte det gamle thinking_budget med thinking_level og fjerne utgåtte parametere som temperature, top_p og top_k. Dette er små detaljer helt til en produksjonsjobb stopper på dem.
Jeg ville heller ikke satt samme nivå globalt for alle oppgaver. En fornuftig ruter kan sende rutinearbeid til low, vanlig agentarbeid til medium og eskalere til high når oppgaven er vanskelig eller et første forsøk feiler. Da betaler du for ekstra arbeid når du faktisk trenger det.
Introduksjonsprisen varer ikke lenge
Den nåværende prisen er midlertidig. Fra 1. januar 2027 dobles standardprisen til 1,50 dollar per million input-token og 7,50 dollar per million output-token. Med dagens omtrentlige valutakurs tilsvarer det rundt 14 kroner inn og 70 kroner ut per million token.
Googles pristabell oppgir også lavere satser for Batch og Flex og høyere satser for Priority. Hvilken kø du bruker, kan derfor påvirke regningen like mye som modellvalget. Oppgaver som ikke haster, bør ikke automatisk sendes gjennom den dyreste veien.
Dette gjør en rask prøveperiode ekstra viktig. En arbeidsflyt som ser rimelig ut i september, kan få både høyere tokenforbruk og dobbel stykkpris etter nyttår. Budsjettet bør regnes med 2027-prisen før du bygger hele produktet rundt modellen, ikke etter at fakturaen kommer.
Gemini 3.7 Flash forblir støttet. Google anbefaler selv forgjengeren når effektivitet er viktigere enn maksimal grundighet. Det er befriende konkret: Nyere er ikke automatisk riktig modell for hver eneste jobb.
Hvordan bør du teste Gemini 3.8 Flash?
Test på faktiske oppgaver fra din egen arbeidsflyt. Bruk samme prompt, samme verktøy, samme datasett og samme krav til godkjenning for 3.7 og 3.8 Flash. Logg input-token, output- og resonneringstoken, antall verktøykall, kjøretid, feilrater og hvor ofte et menneske må rette resultatet.
Ikke stopp ved kostnaden per API-kall. Mål kostnad per godkjent leveranse. Hvis 3.8 Flash bruker flere token, men fjerner nok mislykkede forsøk og nye kjøringer, kan den være et bedre kjøp. Hvis kvaliteten er lik på en enkel jobb, er det liten grunn til å betale for mer tenking.
Jeg ville startet med et lite, representativt sett og kjørt det på alle tre resonneringsnivåene. Sett et tak på antall verktøyrunder, og ha en tydelig stoppregel når agenten går i sirkel. Følg også med på timeout og treghet. Googles eget modellkort nevner både sporadisk treghet, timeout og høyere tokenbruk som kjente begrensninger.
Har du allerede en effektiv løsning med 3.7 Flash, trenger du ikke rive den ut. Kjør 3.8 som utfordrer i bakgrunnen først. Behold forgjengeren for rutinejobber og flytt bare de oppgavene der den nye modellen dokumenterbart gir bedre totaløkonomi eller kvalitet.
Hva er forskjellen på Gemini 3.8 Flash og Flash Cyber?
Gemini 3.8 Flash er den allment tilgjengelige modellen. Gemini 3.8 Flash Cyber er en separat variant for sårbarhetsjakt og automatisert patching, med mer tillatende sikkerhetsgrenser for cyberarbeid. Cyber-utgaven tilbys bare til betrodde cybersikkerhetsmiljøer gjennom Googles Fairwind-program.
De to variantene bygger på samme grunnleggende intelligens, men er laget for forskjellige miljøer. Vanlig 3.8 Flash har strengere vern mot misbruk innen blant annet cyberangrep. Cyber-varianten åpner for mer omfattende defensive oppgaver, og Google begrenser derfor tilgangen til blant andre programvarevedlikeholdere, kritisk infrastruktur og betrodde myndighetsmiljøer.
For de fleste utviklere er dette bare et viktig navneskille. Du får ikke de utvidede cybermulighetene ved å velge gemini-3.8-flash i API-et. Samtidig sier Cyber-satsingen noe om hvor mye av treningen og agentarbeidet bak 3.8-serien som handler om å finne feil, bruke verktøy og rette kode over flere runder.
Er Gemini 3.8 Flash verdt å bytte til?
Ja, den er verdt å teste hvis du bygger kodeagenter, kjører lange arbeidsflyter eller trenger en modell som kan kontrollere eget arbeid over flere steg. Den bør ikke få overta alle jobbene dine uten målinger. Googles egen forklaring gjør det klart at bedre grundighet kan kjøpes med flere token.
Dette er også et skifte i hvordan vi må sammenligne AI-modeller. Pris per million token er ikke lenger nok. Når modeller selv bestemmer hvor lenge de skal tenke og hvor mange verktøyrunder de skal ta, blir kostnad per løst oppgave det tallet som betyr noe.
Gemini 3.8 Flash kan godt vise seg å være billigere i praksis dersom den gjør færre feil og trenger færre nye forsøk. Men det må vises i loggene dine. Ikke i en lanseringstabell.
Mitt råd er derfor å bruke introduksjonsperioden til en kontrollert sammenligning, sette resonneringsnivå per oppgavetype og beregne budsjettet med prisene som gjelder fra 1. januar 2027. Behold 3.7 Flash der den gjør jobben godt nok. La 3.8 Flash jobbe hardere der hardere arbeid faktisk lønner seg.
Ofte stilte spørsmål
Er Gemini 3.8 Flash dyrere enn 3.7 Flash?
Ikke per million token i introduksjonsperioden. Begge koster 0,75 dollar for input og 3,75 dollar for output per million token til 31. desember 2026 – cirka 7 og 35 kroner. Gemini 3.8 Flash kan likevel koste mer per oppgave fordi den kan bruke flere resonneringstoken og flere verktøyrunder.
Blir resonneringstoken fakturert i Gemini API?
Ja. Googles output-pris inkluderer resonneringstoken. En kort tekst på skjermen kan derfor skjule et større fakturert forbruk når modellen har tatt mange interne steg før den svarer.
Kan jeg redusere tokenbruken i Gemini 3.8 Flash?
Ja. Sett thinking_level til low for enkle eller tidskritiske oppgaver, og bruk medium eller high bare når oppgaven trenger mer resonnering. Du kan også fortsette med 3.7 Flash i arbeidsflyter der lavt forbruk er viktigst.
Når dobles prisen på Gemini 3.8 Flash?
Standardprisen dobles 1. januar 2027 til 1,50 dollar per million input-token og 7,50 dollar per million output-token. Det er omtrent 14 og 70 kroner med en dollarkurs rundt 9,34 kroner.