Innhold Vis
Hvis du synes en stemme fra en svart høyttaler føles litt livløs, gir Gemini 3.8 Live Avatar nå Googles tale-AI et ansikt som snakker, lytter og reagerer i sanntid. Ansiktet beveger leppene i takt med talen, skifter uttrykk og kan fortsette samtalen mens agenten henter data fra andre systemer i bakgrunnen.
Det høres fort ut som pynt. Det er det ikke. Google kobler avatarvideoen direkte til en modell som tar imot tale, tekst, kamerabilder og skjermdeling i én løpende sesjon. Dermed kan en kundeserviceagent se produktet du holder foran kameraet, svare med stemme og ansikt og samtidig opprette en sak i et CRM-system.
Dette er en reell og ganske spennende utvidelse av tale-AI. Samtidig er målgruppen foreløpig bedrifter, ikke vanlige Gemini-brukere som vil ha en digital venn på mobilen. Live Avatar er tilgjengelig i Gemini Enterprise, og en egen avatar basert på et bestemt ansikt krever særskilt godkjenning fra Google.
Hva er Gemini 3.8 Live med Live Avatar?
Gemini 3.8 Live med Live Avatar er Googles sanntidsmodell for toveis tale, levende videoforståelse og synkronisert avatarvideo. Modellen genererer en MP4-videostrøm med 24 bilder i sekundet, mens talen leveres som 24 kHz lyd. Googles utviklerdokumentasjon beskriver ventetiden som under ett sekund.
En vanlig taleassistent hører et spørsmål og svarer med lyd. Live Avatar legger til et visuelt lag som lages samtidig med svaret. Ansiktsuttrykk, munnbevegelser og stemme skal henge sammen, uten at utvikleren først må sende lyden til en separat lipsync-tjeneste og vente på ferdig video.
Det er denne koblingen som gjør lanseringen mer interessant enn en animert kundeservicemaske. Gemini 3.8 Live har følelsestilpasset dialog og filtrering av bakgrunnslyd slått på som standard. Modellen skal lytte etter tonefall, pauser og følelsesmessige signaler, samtidig som den prøver å overse samtaler som ikke er rettet mot agenten.
Live Avatar ble omtalt av The Verge 24. september 2026, mens Googles egen lanseringsside er datert 25. september. Det kom omtrent én uke etter den underliggende Gemini 3.8 Live-modellen. Funksjonen kan enkelt beskrives som en animert AI-persona som reagerer mens samtalen pågår. Den beskrivelsen er riktig, men den skjuler nesten hvor mye som skjer bak ansiktet.
Hvorfor er avataren mer enn visuell pynt?
Live Avatar kan behandle tale og visuell informasjon samtidig, utføre verktøykall i bakgrunnen og holde samtalen i gang mens den venter på svar. Det åpner for en agent som både kan se problemet, forklare hva som skjer og arbeide i bedriftens systemer uten en pinlig stillhet mellom hvert steg.
Tenk på en forsikringssak. Kunden viser en skade med mobilkameraet, mens agenten stiller oppfølgingsspørsmål og fyller ut saken. Et team av bakenforliggende agenter kan kontrollere vilkår og bygge dokumentpakken mens avataren fortsetter samtalen. Google viser nettopp en slik demonstrasjon i sin bedriftslansering.
Asynkrone verktøykall er viktige her. En agent kan slå opp en bestilling, kalle et API eller hente data fra CRM- og ERP-systemer uten at hele samtalen stopper. Det synlige ansiktet er altså inngangen til en handlende agent, ikke selve produktet.
Det gir også nye muligheter for opplæring, veiledning og digitale resepsjoner. En avatar kan vise informasjon på skjermen, tolke det brukeren peker kameraet mot og forklare neste steg muntlig. Om det føles mer hjelpsomt eller bare merkelig, avhenger nok av utførelsen. Et ansikt gjør en dårlig agent mer synlig, ikke smartere.
Hvordan virker tale, video og avbrudd sammen?
Gemini 3.8 Live bruker toveis WebSocket-strømming. Den tar imot 16 kHz PCM-lyd, tekst og kamerabilder på 1 bilde i sekundet, og returnerer 24 kHz lyd sammen med avatarvideo på 24 bilder i sekundet. Det er en stor forskjell på å forstå én kameraramme i sekundet og å tegne et bevegelig ansikt i 24 bilder i sekundet, så tallene bør ikke blandes.
Modellen kan også motta en skjermdeling. En støtteagent kan dermed se samme skjerm som brukeren og forklare neste handling med tale. Google trekker fram Autotraders bilassistent, som kobler naturlig samtale mot selskapets bilutvalg.
Avbruddshåndteringen er endret fra den eldre Gemini 2.5 Flash Live-modellen. Gemini 3.8 Live skal vente dersom brukeren allerede snakker, i stedet for å fortsette over vedkommende. Blokkerende verktøykall kan dessuten avbrytes automatisk når samtalen skifter retning. Det virker som en liten detalj helt til du har prøvd å snakke med en robot som aldri skjønner at du ombestemte deg.
Den tidligere Gemini 3.1 Flash Live gjorde sanntids tale og video tilgjengelig i API-et. Gemini 3.8 Live bygger videre med den synlige personen, bedre turtaking og mer selvstendig verktøybruk. Det er et tydelig steg fra en stemmefunksjon til en hel samtaleflate.
Kan Live Avatar bytte språk midt i samtalen?
Live Avatar støtter automatisk overgang mellom 97 språk. Google sier at modellen kan bytte språk underveis uten en manuell bryter, samtidig som munnbevegelser og ansiktsuttrykk tilpasses den nye talen uten synlig drift i videoen. Det er en sterk påstand, og foreløpig først og fremst dokumentert gjennom Googles egne demonstrasjoner.
Språkbyttet er likevel mer enn en morsom demo. En kundeserviceagent kan begynne på norsk, gå over til engelsk når en teknisk kollega kobles inn og fortsette på et tredje språk uten at utvikleren bytter modell eller videoløsning. Det er akkurat slike overganger som vanligvis avslører en sammensatt kjede av talegjenkjenning, oversettelse, talesyntese og lipsync.
Google har allerede vist at tale og språk er en viktig del av Gemini-familien. Gemini 3.5 Live Translate er spesialisert for sanntidsoversettelse. Live Avatar bruker den flerspråklige evnen i en bredere samtaleagent, der språk, ansikt, visuell forståelse og handlinger skal holde samme rytme.
Jeg ville likevel testet de faktiske språkparene før en bedrift lover støtte på 97 språk. Uttale, høflighetsnivå, avbrudd og kulturelle samtalemønstre kan variere selv når modellen teknisk sett bytter språk. En pen munnbevegelse er ikke det samme som god kundeservice.
Kan bedriften bruke sitt eget ansikt og sin egen stemme?
Bedrifter kan velge mellom ferdige avatarer og HD-stemmer i Gemini Live API. En egen avatar kan opprettes fra et referansebilde og kombineres med en ferdigstemme eller en tilpasset stemme, men denne funksjonen er bare tilgjengelig for utvalgte kunder gjennom en godkjenningsordning.
Konfigurasjonsguiden krever at avatarvideo velges som responsformat, og at avataroppsettet sendes når sesjonen starter. For en egen avatar oppgir Google PNG som bildeformat og minst 704 x 1280 piksler. Bilder av mindreårige og kjendiser er ikke tillatt.
Bedriften er selv ansvarlig for nødvendige samtykker og rettigheter til ansikts- og stemmeprøver. Det er helt rimelig. Når en AI-agent ser ut og høres ut som et bestemt menneske, må det være krystallklart hvem som har godkjent bruken.
Alt generert lyd- og videoinnhold får et usynlig SynthID-vannmerke. Google tilbyr også amerikanske og europeiske endepunkter, provisioned throughput og bedriftskontroller for datastyring. Det fjerner ikke bedriftens ansvar, men det viser at produktet er laget for drift og ikke bare for en glanset scenevisning.
Hva koster Gemini 3.8 Live Avatar?
Google priser Gemini 3.8 Live API etter modalitet og antall token. I den gjeldende pristabellen koster tekst inn 0,75 dollar per million token, bilde og video inn 1 dollar, lyd inn 3 dollar, tekst ut 4,50 dollar, lyd ut 12 dollar og avatarvideo ut 1 dollar per million token.
Med en dollarkurs på omtrent 9,5 kroner tilsvarer det cirka 7, 10, 29, 43, 114 og 10 kroner per million token. Google oppgir dessuten en omregning på 6 192 avatarvideotoken per sekund. Det gjør selve avatarvideoen til omtrent 3,50 kroner per minutt mens avataren snakker. Lyttetiden faktureres ikke som avatarvideo, men lyd, innhold inn, tekst og andre deler av sesjonen kommer i tillegg.
En enkel tokenpris er derfor ikke det samme som en komplett samtalepris. En virkelig belastningstest er langt viktigere: samtidige sesjoner, sesjonslengde, hvor mye avataren faktisk snakker, lyd- og videoinnhold og verktøykall påvirker den faktiske regningen. Bedrifter som trenger garantert kapasitet kan avtale provisioned throughput med Google.
Prisen må dessuten sees sammen med tilgangen. Vanlige Gemini-abonnenter får ikke Live Avatar som en ny knapp i forbrukerappen. Bedriften må bruke Gemini Enterprise eller bygge mot Gemini Live API, og en egen avatar krever kontakt med Googles Cloud-team.
Hva bør du teste før Live Avatar møter kunder?
Start med en ferdig avatar og en avgrenset oppgave. Test om agenten forstår norsk tale med bakgrunnsstøy, hvordan den håndterer avbrudd, og om ansiktet fortsatt virker naturlig når et verktøykall tar flere sekunder. Mål hele opplevelsen, ikke bare svartiden fra modellen.
Gi agenten minst mulig tilgang i starten. Lesetilgang til én datakilde er et bedre første steg enn skriverettigheter i CRM, ERP og betalingssystemer samtidig. Legg inn menneskelig godkjenning før agenten sender inn en sak, endrer en bestilling eller gjør noe som ikke enkelt kan reverseres.
Test også hva som skjer når riktig svar mangler, kameraet viser noe uklart eller brukeren skifter språk midt i en kritisk handling. Et ansikt kan øke tilliten langt raskere enn den faktiske påliteligheten. Derfor må avataren tydelig opptre som AI, og brukeren må enkelt kunne be om et menneske.
Gemini 3.8 Live Avatar peker mot en ny type grensesnitt der AI-agenten ikke bare er en tekstboks eller en løs stemme. Den ser, snakker og handler mens du følger med. Det kan gjøre digitale tjenester langt mer tilgjengelige og menneskelige. Men først når agenten faktisk løser oppgaven. Ansiktet kjøper noen sekunder med oppmerksomhet. Resten må modellen fortjene.
Ofte stilte spørsmål
Er Gemini Live Avatar tilgjengelig for vanlige Gemini-brukere?
Nei. Live Avatar er lansert for Gemini Enterprise, og bedriftskunder kan bygge med Gemini Live API. Det er ikke en generell avatarfunksjon i den vanlige Gemini-appen. Tilpassede avatarer krever i tillegg særskilt godkjenning fra Google.
Hvor mange språk støtter Gemini 3.8 Live Avatar?
Google oppgir 97 språk med automatisk språkbytte. Modellen skal kunne skifte språk under samme samtale og tilpasse tale, leppebevegelser og ansiktsuttrykk uten manuell omkobling. Kvaliteten bør testes i de konkrete språkene før produksjonsbruk.
Kan jeg lage en Gemini-avatar av mitt eget ansikt?
Ja, men ikke med vanlig åpen tilgang. En egen avatar kan lages fra et referansebilde, men funksjonen er bare tilgjengelig for godkjente bedriftskunder. Du må ha nødvendige rettigheter og samtykker til både ansikts- og stemmematerialet som brukes.
Merker Google AI-generert lyd og video fra Live Avatar?
Ja. Google oppgir at all generert lyd og video fra Live Avatar får et usynlig SynthID-vannmerke. Det skal gjøre innholdet mulig å identifisere som AI-generert uten et synlig merke i selve videobildet.