Innhold Vis
Hvis du bygger taleagenter som skal svare raskt og fullføre oppgaver, gir Grok Voice Think Fast 2.0 deg en bedre motor – men til en klart høyere pris. xAI viser til bedre samtaleflyt, transkripsjon og verktøybruk, mens minuttprisen øker med 60 prosent.
Men forbedringen er ikke gratis. xAI har satt prisen til 0,08 dollar per minutt lyd, omtrent 77 øre med en dollarkurs rundt 9,66 kroner. Det tilsvarer cirka 46 kroner per time lyd og er 60 prosent dyrere enn Think Fast 1.0.
Dette er derfor mer enn en modelloppdatering med noen pene prosenttall. Den praktiske saken er om raskere respons, bedre transkripsjon og mer pålitelig verktøybruk sparer nok mislykkede samtaler til å forsvare prisøkningen. For kundeservice, booking og telefonsalg kan svaret fort være ja. For en enkel stemmeassistent er det langt mindre opplagt.
Hva er Grok Voice Think Fast 2.0?
Grok Voice Think Fast 2.0 er xAIs nye speech-to-speech-modell for taleagenter. Den tar imot lyd, resonnerer, bruker verktøy og svarer med tale i samme sanntidsløp. Modellen ble lansert 29. juli 2026 og er tilgjengelig både via API-et og i Voice Agent Builder, ifølge xAIs offisielle kunngjøring.
Voice Agent Builder er no-code-flaten rundt modellen. Der kan en bedrift sette opp instruksjoner, kunnskapsbase, verktøy, telefoni, SIP, WebSocket og guardrails uten å bygge hele stemmestakken fra bunnen. Jeg skrev nylig mer detaljert om hvordan Grok Voice Agent Builder kobler tale, telefoni og verktøy.
Det nye nå er altså ikke selve builderen, men motoren som driver samtalen. Think Fast 2.0 erstatter ikke bare stemmen eller gjør den litt hyggeligere. xAI har jobbet med hvor raskt agenten begynner å svare, hvor godt den forstår dårlig lyd, hvordan den takler avbrytelser, og om den klarer å bruke riktige verktøy gjennom en hel arbeidsflyt.
Hvor mye raskere svarer modellen?
Think Fast 2.0 begynte å sende lyd etter 0,70 sekunder i snitt i testen til Artificial Analysis. Det plasserer modellen blant de raskeste tale-til-tale-modellene i oversikten, mens forgjengeren var merkbart tregere i det samme oppsettet.
Et halvt sekund høres kanskje beskjedent ut på papiret. I en tekstchat er det knapt merkbart. I en telefonsamtale kommer det samme halvet sekundet etter spørsmål, bekreftelser og verktøykall, og da begynner praten fort å føles treg og kunstig. Lavere tid til første lyd er derfor en av forbedringene brukeren faktisk kan merke uten å se en eneste benchmark.
Samtidig må ikke 0,70 sekunder forveksles med tiden det tar å løse hele oppgaven. Et oppslag i et ordresystem, en kalender eller et eksternt API kan fortsatt legge til ventetid. Målingen sier hvor raskt modellen begynner å svare under testen, ikke at alle integrasjoner plutselig blir raske.
Blir samtalene og verktøybruken bedre?
Ja, i de publiserte målingene er det særlig samtaleflyt og agentarbeid som skiller versjonene. Think Fast 2.0 gjør et tydelig hopp på Full Duplex Bench sammenlignet med 1.0. Testen måler blant annet turtaking, pauser, avbrytelser og korte bekreftelseslyder som ikke skal tolkes som et nytt spørsmål.
Det er en viktigere forbedring enn en marginal økning i ren resonnering. Folk snakker ikke som de skriver en prompt. De stopper midt i setningen, ombestemmer seg, sier «mhm», avbryter og retter telefonnummeret de nettopp oppga. En taleagent som har riktig faktasvar, men misforstår rytmen i samtalen, blir fortsatt slitsom å bruke.
Den agentiske delen av testen viser også en forbedring, men hoppet er mindre enn for samtaleflyt. Her må agenten løse realistiske oppgaver innen fly, handel og telekom ved hjelp av regler og verktøy. Denne målingen er mer direkte knyttet til om agenten faktisk får jobben gjort.
xAI sier også at verktøykall i produksjon vanligvis kan starte før agenten er ferdig med sin første setning. I leverandørens egen måling bruker modellen klart færre resonneringstokens enn forgjengeren. Den tenker altså mens den snakker, men er trent til å gjøre det interne arbeidet mer effektivt.
Hva betyr bedre transkripsjon i praksis?
xAI hevder at Think Fast 2.0 gir bedre transkripsjonsnøyaktighet enn Deepgram Nova 3, ElevenLabs Scribe v2 og forgjengeren i selskapets egen evaluering. Testen omfattet tusenvis av korte fraser på 24 språk.
Fordelen skal være spesielt tydelig under kraftig bakgrunnsstøy og telefonkomprimering, målt med word error rate der lavere er bedre. Dette er leverandørens egen test, så resultatet bør ikke behandles som en naturlov. Likevel treffer testoppsettet et reelt problem: navn, adresser, e-post, ordrenumre og rettelser er akkurat der en telefonsamtale kan gå fra nyttig til håpløs.
xAI oppgir at modellen skal gi bedre resultater uten at eksisterende prompts må skrives om. Det er lovende for dem som allerede har en agent i drift, men jeg ville likevel kjørt egne regresjonstester. Bedre gjennomsnittstall garanterer ikke at den samme samtaleflyten, stemmen og verktøyrekkefølgen oppfører seg identisk i ditt oppsett.
Hva koster Grok Voice Think Fast 2.0?
Prisen er 0,08 dollar per minutt lyd, omtrent 77 øre, eller 4,80 dollar per time – cirka 46 kroner. Den offisielle pristabellen til xAI viser fortsatt Think Fast 1.0 til 0,05 dollar per minutt, omtrent 48 øre. Oppgraderingen betyr dermed en prisøkning på 60 prosent.
En bedrift med 10 000 minutter samtaletid i måneden går isolert sett fra 500 til 800 dollar i modellkostnad. Med dagens kurs er det omtrent fra 4 800 til 7 700 kroner, før telefoni, egne systemer og eventuelle eksterne verktøy kommer i tillegg. Tekstmeldinger som sendes inn i samtalen prises dessuten separat med 0,004 dollar per melding.
Det riktige regnestykket er likevel ikke bare pris per minutt. Hvis bedre forståelse og verktøybruk forkorter samtaler, reduserer antall overføringer til mennesker eller hindrer at kunden må ringe på nytt, kan totalprisen gå ned selv om minuttprisen går opp. xAI sier at en A/B-test hos Starlink ga høyere salgskonvertering og flere supportsaker løst uten overføring, men selskapet publiserer ikke de konkrete utslagene for 2.0.
Et fornuftig pilotoppsett bør derfor logge mer enn samtalelengde. Mål hvor mange oppgaver som fullføres riktig, hvor ofte agenten må spørre om samme informasjon på nytt, hvor mange samtaler som overføres, og hvor ofte et menneske må rette resultatet etterpå. Da får du et kostnadsbilde som sier noe om arbeid utført, ikke bare hvor lenge kunden og modellen holdt linjen opptatt.
Derfor ville jeg målt kostnad per løst sak, ikke bare kostnad per minutt. En billig agent som roter bort kundens adresse tre ganger er ikke billig. En dyrere agent som løser oppgaven på første forsøk kan være det.
Må eksisterende brukere gjøre noe?
Bruker du det konkrete modellnavnet grok-voice-think-fast-2.0, kan du velge oppgraderingen nå. Bruker du aliaset grok-voice-latest, flytter xAI det automatisk fra 1.0 til 2.0 den 5. august 2026, ifølge selskapets release notes.
Det betyr at «ingen handling nødvendig» egentlig bare gjelder hvis du er komfortabel med både endret oppførsel og høyere pris. Produksjonssystemer bør testes før datoen. Kontroller særlig avbrytelser, stillhet, vanskelige navn og numre, verktøykall, overføring til menneske og grensene du har satt i guardrails.
Vil du beholde dagens modell og pris, må du feste integrasjonen til grok-voice-think-fast-1.0 før byttet. Det er ingen krise, men det er en klassisk grunn til at «latest» er praktisk i testing og litt mer spennende enn ønskelig i produksjon.
Er oppgraderingen verdt 60 prosent høyere pris?
For taleagenter som håndterer ekte kundesamtaler, er Think Fast 2.0 sannsynligvis verdt å teste. Kortere tid til første lyd, bedre samtaledynamikk og mer pålitelig verktøybruk angriper tre av de vanligste grunnene til at en voice agent føles som en demo i stedet for en tjeneste.
Jeg ville likevel ikke oppgradert blindt. Den samlede indeksen til Artificial Analysis er en vektet sammenslåing av resonnering, samtaleflyt og agentoppgaver. Din viktigste måling kan være noe helt annet: korrekt booking, færre feil i adresser, kortere samtaler eller andelen saker som må sendes videre.
Poenget er ganske enkelt: Dette ser ut som en reell forbedring, ikke bare nytt modellnavn. Men xAI tar også betalt som om forbedringen er reell. Kjør de vanskeligste samtalene dine gjennom begge versjonene, mål kostnad per løst oppgave, og la tallene avgjøre.
\nOfte stilte spørsmål
\n\n\n\nNår blir Grok Voice Think Fast 2.0 standardmodellen?
Aliaset grok-voice-latest flyttes automatisk til Think Fast 2.0 den 5. august 2026. Vil du beholde 1.0, må integrasjonen bruke det faste modellnavnet grok-voice-think-fast-1.0 før byttet skjer i produksjon.
Hvor mye koster én time med Grok Voice 2.0?
Én time lyd koster 4,80 dollar, omtrent 46 kroner med en dollarkurs rundt 9,66 kroner. Telefoni, eksterne verktøy og tekstmeldinger kan komme i tillegg, så faktisk kostnad avhenger av oppsettet.
Kan Think Fast 2.0 brukes i Voice Agent Builder?
Ja. Modellen er tilgjengelig i xAIs Voice Agent Builder og gjennom Speech to Speech API-et. Builderen samler blant annet instruksjoner, kunnskapsbase, verktøy, telefoni og kontrollregler rundt selve talemodellen i ett grensesnitt.
Må prompts skrives om for den nye modellen?
xAI forventer bedre ytelse uten endringer i eksisterende prompts. Produksjonsagenter bør likevel regresjonstestes, særlig på avbrytelser, tall, verktøykall og overføring til mennesker, før aliaset byttes automatisk den 5. august.