Gemini Robotics 2 lar AI styre en humanoid robot fra føtter til fingertupper, ikke bare flytte én robotarm mellom faste punkter. Det er et viktig steg mot roboter som kan forstå en oppgave, planlegge den og tilpasse hele kroppen mens omgivelsene endrer seg.

Hvis du har fulgt AI-utviklingen gjennom chatboter og kodeagenter, er dette den samme grunnideen på vei ut av skjermen. Forskjellen er at en feil ikke lenger bare gir et dårlig svar eller en ødelagt fil. Nå kan modellen balansere en tung maskin, bøye seg mellom mennesker og gripe en lyspære med en hånd som har 22 bevegelige ledd.

Google DeepMind omtaler lanseringen som enda et steg mot «physical AGI». Det er en stor formulering. Googles egne resultater viser samtidig noe mer interessant og langt mer jordnært: Systemet har fått betydelig bredere fysisk kapasitet, men lykkes fortsatt bare i 32 til 92 prosent av forsøkene på flere av de konkrete fingerferdighetsoppgavene. Dette er lovende forskning, ikke en ferdig hushjelp som banker på døren neste uke.

Hva er Gemini Robotics 2?

Gemini Robotics 2 er en familie på tre modeller som fordeler jobben mellom resonnering og fysisk handling. Hovedmodellen gjør syn og språk om til motorstyring, ER 2 planlegger og vurderer framdriften, mens On-Device 2 er laget for lokal kjøring. WIRED beskriver systemet som en kombinasjon av én syns- og språkmodell og to vision-language-action-modeller.

Den arbeidsdelingen er viktig. En språkmodell kan forstå at «rydd hyllen» innebærer å identifisere gjenstander, finne ledig plass og velge en rekkefølge. En VLA-modell må gjøre planen om til bevegelser som faktisk virker i en kropp med armer, ben, hender og balanse. Gemini Robotics ER 2 fungerer som hjernen på høyt nivå og sender utføringen videre til modellen som kontrollerer maskinvaren.

Google sier at systemet kan brukes på alt fra bordmonterte robotarmer til komplette humanoider. On-Device 2 kan tilpasses en ny robotkropp med treningsdata samlet inn over noen timer. Målet er altså ikke å trene én separat AI fra bunnen av for hver maskin. Den samme intelligensen skal kunne flyttes mellom ulike kropper, omtrent slik et operativsystem kan brukes på ulik maskinvare.

Det bygger videre på det Google allerede gjorde med Gemini Robotics-ER 1.6. Den forrige generasjonen handlet mye om å forstå rom, lese instrumenter og planlegge handlinger. Versjon 2 kobler dette tydeligere til helkroppsstyring, mer avanserte hender og flere roboter som løser samme oppgave.

Humanoid robot kobler Gemini Robotics 2-resonnering til helkroppskontroll i testlaboratorium
Modellfamilien fordeler jobben mellom forståelse, resonnering og fysisk styring av robotkroppen.

Helkroppskontroll er den virkelige nyheten

Den største endringen er at modellen kan balansere og flytte hele kroppen mens den arbeider. I stedet for å rekke ut en arm fra en fast posisjon kan en humanoid ta et skritt, sette seg på huk, bøye overkroppen og justere tyngdepunktet. Google viser helkroppstester der Apollo-roboten henter gjenstander fra et bord, gulvet og en hylle.

I Googles egne tester lyktes roboten i 68,4 prosent av forsøkene fra bordet, 45,7 prosent fra gulvet og 76,3 prosent fra hyllen. Tallene er ikke direkte sammenlignbare med en tilfeldig robot i et annet rom, og de kommer fra leverandøren selv. Likevel sier de mer enn en blankpolert demovideo: Helkroppskontrollen fungerer ofte, men langt fra alltid.

Det er nettopp kombinasjonen som er vanskelig. Roboten må se hvor objektet ligger, forstå hvordan det kan gripes, plassere føttene, holde balansen og koordinere arm og hånd. Endrer gjenstanden posisjon, må planen justeres uten at hele sekvensen starter på nytt. Hvert enkelt problem er krevende. Gemini Robotics 2 forsøker å løse dem som én sammenhengende oppgave.

Google har jobbet med robotikk lenge, og det merkes. Selskapet samarbeider blant annet med Apptronik, Agile Robots og Boston Dynamics. Der OpenAI og Anthropic har tatt ledelsen med chatboter og AI-verktøy for koding, har Google en realistisk mulighet til å gjøre Gemini til intelligenslaget for mange typer roboter.

Hvor flinke er hendene i praksis?

Gemini Robotics 2 kan styre robothender med 22 frihetsgrader, men resultatene varierer kraftig mellom oppgavene. I Googles tester klarte Apollo å skru ut en lyspære i 92 prosent av forsøkene, mens den bare klarte å skru inn lyspæren i 36 prosent. Å knyte en søppelpose lyktes i 44 prosent av forsøkene.

Andre oppgaver lå på 32 prosent for bruk av feiebrett og 40 prosent for lukking av en plastpose. Dette er ikke dårlige resultater for en generell modell som håndterer krevende fingre og gjenstander. Men de gjør det vanskelig å late som roboten er klar for selvstendig arbeid i et uforutsigbart hjem eller en fabrikk der nesten riktig kan bli både dyrt og farlig.

Med enklere parallelle gripere på Franka Duo ble resultatene langt jevnere. Generell plukk og plasser nådde 74,2 prosent, sortering av ulike verktøy 78,9 prosent og presis innsetting 89,6 prosent. Det forteller også noe viktig om humanoide roboter: Menneskelignende hender gir større fleksibilitet, men de gir modellen langt flere bevegelser å kontrollere.

Den praktiske verdien kommer derfor trolig først i avgrensede arbeidsmiljøer. En robot som gjør fem kjente oppgaver på et lager, med mennesker i nærheten og klare sikkerhetsgrenser, er noe annet enn en robot som skal håndtere alt et menneske kan finne på. «Generell» betyr her at modellen kan tilpasse seg flere oppgaver og maskiner. Det betyr ikke at den mestrer alt.

To roboter kan dele opp samme jobb

Gemini Robotics ER 2 kan koordinere flere roboter i samme område. Modellen skal forstå hvilke fysiske styrker hver maskin har, dele opp oppgaven og la robotene kommunisere om framdriften. Det flytter fokuset fra én imponerende humanoid til et system der ulike roboter kan bidra med det de faktisk er gode på.

Det er mer praktisk enn det høres ut. En mobil robot kan frakte deler, en arm kan gjøre presis montering, og en humanoid kan håndtere områder som er bygget for mennesker. Hvis alle må få hvert sitt lukkede styresystem og sin egen plan, blir automasjonen fort stiv. Et felles resonneringslag kan i prinsippet omfordele jobben når én maskin står fast.

Googles tester av ER 2 viser 60 prosent suksess når modellen styrte en ekte VLA, opp fra 48,6 prosent for ER 1.6. I simulering økte resultatet fra 37,4 til 42,9 prosent. Ved menneskelig fjernstyring som utførende ledd gikk det fra 63,6 til 74 prosent.

Det mest interessante er ikke at alle tallene går opp. Det er avstanden mellom resonnering og pålitelig fysisk utføring. Modellen kan lage en god plan og oppdage at oppgaven ikke er ferdig, men robotkroppen må fremdeles klare grep, friksjon, balanse og alle de små overraskelsene virkeligheten serverer. Verden har ingen angreknapp. Irriterende upraktisk, men sant.

Tre roboter samarbeider gjennom Gemini Robotics 2 om én industrioppgave
Et felles resonneringslag kan fordele oppgaver mellom roboter med ulike fysiske styrker.

Hva betyr lokal kjøring for robotene?

On-Device 2 er den letteste modellen i familien og er optimalisert for å kjøre direkte på roboten. Det reduserer avhengigheten av internett og forsinkelsen som oppstår når bilder og kommandoer må sendes til et datasenter før roboten får neste bevegelse tilbake.

For en chatbot kan noen ekstra tideler være litt irriterende. For en robot i bevegelse kan forsinkelsen være forskjellen på å stoppe foran en person og å fortsette et halvt skritt for langt. Lokal kjøring gjør også roboten mer robust på steder med svak dekning, og modellen er laget for å kunne tilpasses nye robotkropper.

Det betyr ikke nødvendigvis at hele systemet alltid kjører lokalt. Familien er laget slik at de ulike modellene kan fylle forskjellige roller. En naturlig løsning kan være lokal motorstyring og raske sikkerhetsreaksjoner, mens tyngre planlegging eller verktøybruk skjer i et større system. Det er arkitekturen, ikke én enkelt modell, som er det sterke kortet.

For norske bedrifter er den direkte robotstyringen foreløpig mer et signal om retningen enn et produkt man bestiller og installerer. Gemini Robotics 2 er i privat forhåndsversjon, og On-Device 2 er begrenset til utvalgte testere. Resonneringsmodellen Gemini Robotics ER 2 er derimot tilgjengelig i offentlig forhåndsversjon via Google AI Studio og Gemini API. Det finnes ingen offentlig pris for selve robotstyringen som gjør det mulig å regne hjem et vanlig prosjekt ennå.

Sikkerhet blir vanskeligere når AI får en kropp

En robot trenger både semantiske regler og gammeldags fysisk sikring. Modellen må forstå at den ikke skal gi en kokende drikk til et barn, men maskinen trenger også kraftgrenser, kollisjonskontroll, nødstopper og et avgrenset arbeidsområde. Google beskriver sikkerheten som flere lag fordi ingen enkelt barriere er perfekt.

I Googles evaluering fulgte ER 2 sikkerhetsinstruksjoner med 97,9 prosent nøyaktighet. Ved vurdering av mennesker innenfor én meter oppnådde modellen 93 prosent. Det er kraftig bedre enn ER 1.6, men selv 97,9 prosent er ikke godt nok hvis den samme farlige situasjonen oppstår tusenvis av ganger. De siste prosentene er ofte de dyreste.

Google sier at roboten er laget for å stoppe når et menneske kommer inn i arbeidsområdet. Selskapet understreker samtidig at dette ikke er et garantert, sikkerhetsklassifisert system. Den presiseringen bør stå med større bokstaver enn «physical AGI». En AI-modell kan være ett lag i sikkerheten, men den kan ikke få være det eneste laget.

WIRED peker også på at frontier-modeller kan handle uventet når de får verktøy og handlingsrom. Med en robot blir konsekvensene mer direkte. Derfor er den virkelige testen ikke om Apollo kan knyte en pose i en kontrollert demo, men om systemet kan feile forutsigbart, stoppe trygt og forklare hva som gikk galt.

Er dette fysisk AGI?

Nei, ikke slik resultatene ser ut nå. Gemini Robotics 2 er et tydelig steg mot mer generelle roboter, men Googles mål om «physical AGI» er en ambisjon. En modell som lykkes med å skru inn en lyspære i 36 prosent av forsøkene, er ikke en robot som kan gjøre alt et menneske kan.

Det er likevel lett å undervurdere hva som faktisk har skjedd. AI-modellen ser ikke lenger bare på verden og beskriver den. Den kan planlegge over flere steg, styre en hel kropp, bruke avanserte hender, kontrollere om jobben ble gjort og fordele arbeid mellom flere maskiner. Dette er flere tidligere separate forskningsproblemer samlet i ett system.

Jeg tror derfor det er feil å måle lanseringen mot science fiction. Det nyttige spørsmålet er om én modellfamilie kan redusere tiden og datamengden som trengs for å gjøre en ny robot nyttig i en avgrenset jobb. Kan den tilpasses på timer, flytte læring mellom maskiner og håndtere flere oppgaver uten ny kode for hver bevegelse, begynner regnestykket å bli interessant.

Men den ærlige dommen er foreløpig todelt. Google har flyttet Gemini et godt stykke ut i den fysiske verden, og helkroppskontrollen er mer enn en pen demo. Samtidig viser selskapets egne tall at veien fra imponerende forsøk til pålitelig arbeidskraft fortsatt er lang. Roboten har fått en langt bedre hjerne. Nå må den lære å være like kjedelig og stabil som maskiner i drift faktisk bør være.

Ofte stilte spørsmål

Kan Gemini Robotics 2 styre en komplett humanoid robot?

Ja. Hovedmodellen kan styre en humanoid fra føtter til fingertupper, inkludert balanse, steg, bøying, armer og hender. Den kan også brukes med enklere robotarmer. Modellen som utfører selve bevegelsene, er foreløpig i privat forhåndsversjon.

Kan bedrifter kjøpe eller laste ned Gemini Robotics 2 nå?

Ikke som et vanlig ferdig robotprodukt. Hovedmodellen og On-Device 2 har begrenset tilgang, mens Gemini Robotics ER 2 kan prøves i Google AI Studio og brukes via Gemini API. Google har ikke publisert en ordinær pris for robotstyringen som norske bedrifter kan bruke i et kostnadsoverslag.

Hva er forskjellen på Gemini Robotics 2 og ER 2?

Gemini Robotics 2 gjør syn og språk om til motorbevegelser. ER 2 er resonneringslaget som forstår omgivelsene, lager en plan, følger framdriften og kan koordinere flere roboter. De er laget for å arbeide sammen som deler av samme system.

Er Gemini Robotics 2 trygg nok til å jobbe alene blant mennesker?

Ikke uten andre sikkerhetssystemer. Google kombinerer modellen med fysiske og operative sperrer og oppgir 93 prosent nøyaktighet i en test med mennesker innenfor én meter. Selskapet sier uttrykkelig at stoppfunksjonen ikke er et garantert, sikkerhetsklassifisert system.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre ved skrivebordet med Claude AI-chat på skjermen

Hva er Claude AI? Komplett guide for nybegynnere (2026)

Hva er Claude AI? En enkel og ærlig guide: hvem som laget det, hvilke versjoner som finnes, hva det koster, og hvordan du kommer i gang i dag.