Grok 4.6 er ute, og denne gangen er lange agentoppgaver selve poenget. SpaceXAI vil at modellen skal holde fast i kompliserte jobber gjennom mange steg – fra research og arbeid i en kodebase til en ferdig app eller et gjennomarbeidet dokument.

Det er en langt mer nyttig ambisjon enn å flytte enda en modell noen hakk opp på en resultatliste. En AI-agent som er glimrende i fem minutter, men mister tråden når oppgaven blir stor, er fortsatt mest en imponerende demo. Grok 4.6 er trent for å holde ut lenger, kontrollere mer av sitt eget arbeid og levere noe du faktisk kan jobbe videre med.

Tallene er sterke. Modellen får 61 poeng på Artificial Analysis Intelligence Index, mot 56 for Grok 4.5, og passerer Kimi K3. Samtidig beholder den startprisen på 2 dollar per million input-tokens og 6 dollar per million output-tokens. Men den vinner ikke alt. Det er nettopp derfor denne lanseringen er interessant.

Hva er nytt i Grok 4.6?

Grok 4.6 er SpaceXAIs nye flaggskipmodell for agentisk koding, research og kunnskapsarbeid. Ifølge den offisielle lanseringen 12. august 2026 er hovedløftet evnen til å gjennomføre ambisiøse oppgaver over mange steg, særlig interaktive og visuelle prosjekter.

SpaceXAI beskriver en lengre supplerende treningsrunde enn for Grok 4.5. Den brukte kuraterte, modellgenererte data for resonnering og avanserte tekniske emner, bedre ingeniørdata og en forbedret treningsoppskrift. Deretter brukte selskapet Grok 4.5 til å lage nye treningsforløp på tvers av ulike resonneringsnivåer, agentmiljøer, programmering, realfag og vanlig kunnskapsarbeid.

Det mest lovende er ikke hvordan treningsprosessen høres ut, men hva SpaceXAI sier de observerte i lengre arbeidsforløp: mer selvtesting og verifisering før modellen gikk videre. Det er akkurat her AI-agenter ofte går i grøften. De kan lage mye, fort, og deretter erklære seier før de har kontrollert om resultatet virker.

Jeg liker retningen SpaceXAI tar med Grok som arbeidsmodell for agenter. Det betyr ikke at jeg automatisk kjøper alle lanseringspåstandene. Men en modell som både holder retningen lenger og sjekker sitt eget arbeid bedre, treffer et reelt problem.

Grok 4.6 sammenlignes med toppmodeller på ulike typer agentarbeid og terminalytelse
Grok 4.6 ligger i toppsjiktet samlet, men resultatene varierer tydelig mellom agentoppgaver og terminalarbeid.

Hvor sterk er modellen mot GPT-5.6 Sol og Kimi K3?

Grok 4.6 ligger helt oppe i toppsjiktet, men ikke alene på toppen. Artificial Analysis måler Grok 4.6 High til 61 poeng, praktisk talt likt GPT-5.6 Sol og litt foran Kimi K3. Den levende resultatlisten plasserer nå Grok 4.6 som nummer seks blant 184 sammenlignbare modeller.

Det siste er verdt å merke seg fordi lanseringsdekningen omtalte modellen som verdens fjerde beste. Begge deler kan ha vært riktig på hvert sitt tidspunkt. AI-resultatlistene endrer seg nå så fort at en plassering kan være gammel før artikkelen er ferdig lest. Selve poengsummen og hvilke oppgaver modellen mestrer, er mer nyttig enn medaljen rundt halsen.

SpaceXAIs egen tabell viser 61 mot 62 for Claude Fable 5 Max, 61 for GPT-5.6 Sol Max og 56 for Grok 4.5 High. På GDPVal-AA v2 ligger Grok 4.6 på 1 753, foran både Sol og Fable i selskapets sammenligning. På CursorBench 3.2 får den 69,9 prosent, mens Fable ligger på 70,5 prosent.

Så kommer haken. På Terminal-Bench 3.0 får Grok 4.6 bare 26 prosent. GPT-5.6 Sol Max ligger på 34,6 prosent og Fable 5 Max på 34,1 prosent. En modell kan altså være glimrende på sammensatte kunnskapsoppgaver og fortsatt ha et tydelig gap på terminalarbeid. «Frontiermodell» betyr ikke «best på alt».

Kimi-sammenligningen er likevel interessant. Jeg er grunnleggende skeptisk til å gjøre parameterantall eller én benchmark til bevis på kvalitet. Praktisk tilgang, stabil drift og hva modellen faktisk får gjort, er minst like viktig. Kimi K2.5 viste allerede hvor raskt Moonshot AI presset seg inn blant de store. At Grok 4.6 passerer Kimi K3 på denne indeksen, sier mest om hvor brutalt tempoet er blitt.

Hva betyr agentløftet i praktisk arbeid?

Agentløftet betyr at Grok 4.6 skal kunne ta en bred bestilling, undersøke et ukjent område, planlegge løsningen, bygge den og forbedre resultatet gjennom flere runder. SpaceXAI trekker særlig fram kodebaser, webutvikling, teknisk design, research og ferdige arbeidsdokumenter.

Det er en annen type oppgave enn å be en chatbot skrive en funksjon eller oppsummere et dokument. Lange agentjobber krever at modellen husker målet, forstår hva som allerede er gjort, oppdager feil og lar være å gjenta gamle forsøk. Jo flere steg den tar, desto flere muligheter får den også til å rote seg bort.

Her kan bedre selvtesting være viktigere enn en liten forbedring i rå intelligens. En modell som skriver litt mindre imponerende kode i første forsøk, men faktisk kjører testene, leser feilmeldingen og retter problemet, kan være langt mer verdifull enn en modell som leverer en pen vegg med kode og sier «ferdig».

SpaceXAI hevder også at Grok 4.6 lager sterkere førsteutkast til visuelle og interaktive prosjekter enn 4.5. Det kan korte ned veien fra idé til noe du kan prøve. Jeg ville likevel vurdert dette på egne oppgaver. En lanseringsdemo er valgt fordi modellen lykkes; din gamle kodebase er sjelden like samarbeidsvillig.

Hva koster Grok 4.6?

Grok 4.6 starter på 2 dollar per million input-tokens og 6 dollar per million output-tokens i API-et. Med siste publiserte dollarkurs fra Norges Bank på rundt 9,5 kroner er det cirka 19 kroner inn og 57 kroner ut per million tokens. Fast-varianten koster det dobbelte, altså omtrent 38 og 114 kroner.

Grunnprisen er den samme som for Grok 4.5. Det er viktigere enn det kanskje ser ut. Lange agentoppgaver kan bruke enorme mengder tokens på planlegging, verktøykall, feilmeldinger og nye forsøk. En modell som nærmer seg de dyreste konkurrentene i kvalitet uten å nærme seg dem i tokenpris, kan endre hvilket arbeid små bedrifter og enkeltutviklere faktisk har råd til å automatisere.

Artificial Analysis beregnet en veid kostnad på 0,84 dollar per oppgave i sin Intelligence Index, omtrent 8 kroner. Det er ikke en prislapp for din oppgave, men en måte å sammenligne effektivitet på innenfor den samme testen. Det forteller mer enn inputprisen alene fordi en billig modell fortsatt kan bli dyr hvis den bruker fire ganger så mange tokens.

Grok 4.6 er tilgjengelig i Grok Build og Cursor, via SpaceXAI API og hos partnere som OpenRouter, Vercel og Cloudflare. Den første uken gir SpaceXAI dobbelt inkludert bruk i Grok Build og Cursor. Hvis du allerede arbeider der, er det et naturlig tidspunkt å kjøre samme reelle oppgave mot 4.5 og 4.6 – ikke bare sende dem hvert sitt hjernetrimspørsmål.

Tokenflyt viser kostnaden ved lange agentoppgaver med Grok 4.6 i praksis
Samme grunnpris som Grok 4.5 kan gjøre lange agentløp mer aktuelle, men total tokenbruk avgjør regningen.

Er 500 000 tokens kontekst nok?

Grok 4.6 har et kontekstvindu på 500 000 tokens, tilsvarende rundt 750 A4-sider i Artificial Analysis sin grove sammenligning. Det er nok til store dokumentbunker, omfattende research og betydelige deler av en kodebase, men kontekstvinduet er ikke det samme som perfekt hukommelse.

Store agentoppgaver trenger både plass og disiplin. Modellen må velge riktig informasjon, vite når gamle detaljer ikke lenger gjelder og holde målet synlig mens verktøyresultater fyller konteksten. En halv million tokens hjelper lite hvis den viktigste feilmeldingen drukner på side 412.

Målt hastighet er rundt 66 output-tokens per sekund, litt under medianen på 68 for sammenlignbare modeller. Artificial Analysis målte også 32,3 sekunder til første svartoken. Det er ikke katastrofalt for et agentløp som skal vare lenge, men det er merkbart i interaktiv bruk. Grok 4.6 føles med andre ord ikke umiddelbar i denne målingen.

Dette gjør Fast-varianten lettere å forstå: Du betaler dobbelt når ventetiden betyr mer enn tokenregningen. For batchjobber og oppgaver som kan gå i bakgrunnen, vil standardvarianten ofte være det mer fornuftige utgangspunktet.

Bør du bytte til Grok 4.6?

Du bør teste Grok 4.6 hvis du bruker AI til lange kodeoppgaver, research eller agentløp der dagens modell mister tråden eller blir for dyr. Ikke bytt fordi den var nummer fire i en overskrift. Bytt hvis den løser hele din oppgave med færre avbrytelser, færre omstarter og en regning du kan leve med.

Lag en liten, ærlig prøve. Gi to modeller samme kodebase eller researchbestilling, samme verktøy og samme krav til ferdig resultat. Mål total kostnad, tidsbruk, hvor mange ganger du måtte gripe inn og om sluttproduktet faktisk virket. Det er kjedeligere enn en benchmarkgraf. Det er også mye mer verdt.

For SpaceXAI er retningen tydelig. Selskapet bygger ikke bare en smartere chatbot, men prøver å gjøre Grok til en vedvarende digital arbeider inne i Cursor, Grok Build og andre plattformer. Det passer med den aggressive oppbyggingen rundt Grok og Colossus 2.

Min foreløpige dom er derfor positiv, med en viktig stjerne i margen. Grok 4.6 har gjort SpaceXAI til en enda mer alvorlig konkurrent for agentarbeid, og prisen er skarp. Men 26 prosent på Terminal-Bench og den lange tiden til første token minner oss om noe AI-selskapene helst skriver med liten skrift: Den beste modellen finnes fortsatt bare i forhold til oppgaven du faktisk skal løse.

Ofte stilte spørsmål

Når ble Grok 4.6 lansert?

Grok 4.6 ble lansert 12. august 2026. Modellen er tilgjengelig i Grok Build og Cursor, via SpaceXAI API og gjennom partnere som OpenRouter, Vercel og Cloudflare.

Er Grok 4.6 bedre enn GPT-5.6 Sol?

Ikke på alt. Begge får rundt 61 poeng på Artificial Analysis Intelligence Index, mens resultatene varierer tydelig mellom enkelttestene. Grok leder enkelte agent- og kunnskapsmålinger, men ligger bak GPT-5.6 Sol på blant annet Terminal-Bench 3.0.

Er Grok 4.6 billigere enn Grok 4.5?

Nei, standardprisen er den samme: 2 dollar per million input-tokens og 6 dollar per million output-tokens, cirka 19 og 57 kroner. Verdien ligger i at 4.6 skal løse mer krevende og langvarige oppgaver til samme grunnpris.

Kan Grok 4.6 brukes til koding?

Ja. Agentisk koding er et hovedområde for Grok 4.6, og modellen er trent på programvareutvikling, webutvikling, tekniske miljøer og lange arbeidsforløp. Test den likevel på din egen kodebase, fordi resultatene varierer betydelig mellom ulike typer kodeoppgaver.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre i et mørkt videoredigeringsstudio med flere skjermer som viser LTX Video 2.3 frames fra en kafé-POV-scene

LTX Video 2.3 – 481 frames og 20 sekunder video på 2,5 minutt lokalt

LTX Video 2.3 (versjon 0.9.8) genererer 20 sekunder vertikal POV-video med 481 frames på 2 minutter og 26 sekunder på RTX 4090. Her er hva som er nytt, hva modellen krever, og hvorfor dette er den sterkeste lokale video-AI-modellen akkurat nå.