Du trenger ikke lenger en skyserver for å snakke med en AI som forstår bilder og lyd. Gemma 4 12B, som Google slapp 3. juni 2026, er den første mellomstore open weights-modellen med innebygd bilde- og lydforståelse som faktisk kjører på en vanlig 16GB laptop – uten månedlig abonnement, uten å sende data til noen.

Det er en milepæl som kanskje ikke høres så dramatisk ut, men det er det. Frem til nå har multimodal AI – altså modeller som forstår både tekst, bilde og lyd – vært forbeholdt store skytjenester. Gemma 4 12B snur det på hodet. Modellen veier 11,95 milliarder parametere, er lisensiert under Apache 2.0 (fri kommersiell bruk, fri modifisering) og er tilgjengelig dag én via Ollama, LM Studio og llama.cpp.

Hva betyr det i praksis? At du kan sende et bilde av et dokument og spørre «hva står her?», laste inn en lydfil og spørre «kan du oppsummere dette?», eller bruke modellen i en lokal agent-pipeline – alt uten å forlate din egen maskin.

Hva er Gemma 4 12B «Unified»?

Google kaller modellen «Unified» fordi den bryter med den tradisjonelle arkitekturen der tekst, bilde og lyd behandles i separate encodere som deretter kobles sammen. I stedet går alle modaliteter rett inn i språkmodell-backbonen gjennom en felles token-mekanisme.

Bilder behandles via en lett embedding-modul – én matriseoperasjon, positional embedding og normalisering – og projiseres direkte inn i samme dimensjonsrom som tekst-tokens. Lyd tas inn som rå 16kHz signal, kuttes i 40ms-rammer og projiseres på samme måte. Videoer prosesseres som enkeltframes. Det er ingen tung separat vision-encoder her, ingen Whisper-lignende lydmodul boltet på siden.

Resultatet er en arkitektur som er overraskende kompakt til hva den klarer. Modellen har 48 lag og støtter et kontekstvindu på 256 000 tokens – stort nok til å prosessere lange dokumenter, halvlange lydopptak eller sekvenser av bilder i én omgang. Den forstår over 35 språk.

Illustrasjon av unified arkitektur der bilde, lyd og tekst flyter inn i samme nevralt nettverk
Unified-arkitekturen: bilde, lyd og tekst projiseres direkte inn i samme dimensjonsrom som tekst-tokens

Kjører den faktisk på en vanlig laptop?

Ja – og det er den viktigste nyheten. Gemma 4 12B krever 16GB VRAM eller unified memory for å kjøre komfortabelt. Det betyr at en MacBook Pro M2 eller M3 med 16GB RAM håndterer den uten problemer. Det samme gjelder de fleste Windows-laptoper med en dedikert GPU i mellomklassen som har 16GB VRAM, som en RTX 4080 laptop.

Google oppgir at ytelsen ligger «nær» den langt større Gemma 4 26B MoE-modellen på under halvparten av minnefotavtrykket. Slike sammenligninger skal alltid tas med en klype salt – oppgavetype betyr enormt mye her – men poenget er at du får mye modell for plassen den tar.

For Apple Silicon-brukere spesielt er dette interessant. MLX-støtte er klar fra dag én, og kombinert med optimalisert MTP-inferens på Apple Silicon kan du forvente reell, brukbar hastighet – ikke bare at den «virker» i teorien.

Hva er «native audio input» – og hvorfor er det nytt?

Gemma 4 12B er Googles første mellomstore modell med innebygd lydforståelse. Det betyr at du kan sende en lydfil direkte til modellen og få et svar tilbake – ingen separat transkripsjonssteg, ingen ekstra pipeline med Whisper foran.

Praktisk sett åpner dette for ting som:

  • Spørre om innholdet i et møteopptak
  • Analysere tonefall eller innhold i en talemelding
  • Lage lokale voice-interface-pipelines uten skyavhengighet
  • Kombinere lyd og bilde i én spørring («ser du personen som snakker i denne videoen?»)

Det er verdt å understreke at «forståelse» her betyr semantisk analyse, ikke nødvendigvis perfekt transkripsjon. For ren ordrett transkripsjon er dedikerte modeller fortsatt sterkere. Men evnen til å tolke, oppsummere og svare på lyd er en helt annen sak – og der er Gemma 4 12B nå med i leken.

Slik kommer du i gang lokalt

Google har gjort det unødvendig komplisert å finne dokumentasjonen, men veien inn er faktisk enkel. Vektene ligger på Hugging Face og Kaggle. Du trenger en gratis konto for å laste dem ned.

Raskeste vei til å teste modellen er via Ollama:

ollama run gemma4:12b

LM Studio oppdateres løpende og bør ha modellen tilgjengelig fra sin modellkatalog kort tid etter slipp. For llama.cpp og vLLM finnes offisielle instruksjoner i Googles Gemma-dokumentasjon. MLX og Unsloth er støttet for de som vil fine-tune modellen.

Én praktisk observasjon fra tidlig testing: legg bildeinnholdet før tekstspørsmålet i prompten for best resultat. Altså:

[bilde]
Hva viser dette bildet?

…i stedet for spørsmål først, bilde til slutt. Det virker å gi mer presise svar fra modellen.

MacBook med terminal åpen viser Ollama-kommando for å kjøre Gemma 4 12B lokalt
Gemma 4 12B via Ollama: én kommando og modellen kjører lokalt på din maskin

Hva er Multi-Token Prediction, og hva betyr det for deg?

Gemma 4 12B inkluderer MTP-draftere (Multi-Token Prediction) innebygd. I stedet for å generere ett token av gangen kan modellen forutsi og verifisere flere tokens parallelt, noe som reduserer latens merkbart på kompatibel hardware.

llama.cpp fikk MTP-støtte og det er dokumentert at det kan gi opptil 2,4 ganger raskere inferens for modeller som støtter det. Gemma 4 12B er bygget med det inn fra starten, ikke boltet på etterpå. Det betyr at du bør se reell hastighetsforbedring uten tweaking – forutsatt at du bruker et inference-rammeverk som støtter MTP.

For Apple Silicon: MTPLX er spesielt optimalisert for dette og er verdt å se på hvis du kjører på MacBook eller Mac Studio.

Hva med agentic bruk og function calling?

Gemma 4 12B støtter function calling og er bygget for agentic workflows fra starten. Google slipper også et offisielt Skills Repository – en samling ferdige kompetanse-moduler du kan koble inn i modellen for spesialiserte oppgaver.

Det betyr at du kan bygge lokale agenter som kan kalle eksterne API-er, manipulere filer, søke på nettet eller utføre kodeoppgaver – og gjøre det uten å sende en eneste prompt til en skyserver. For de som vil bygge noe som faktisk gjør ting, og ikke bare svarer, er dette vesentlig.

Det er fremdeles tidlige dager for lokal agentic AI, men retningen er klar. Se gjerne den komplette guiden til open source AI for mer kontekst rundt hva som finnes av rammeverk og tilnærminger her.

Gemma 4 12B vs de andre åpne modellene akkurat nå

Det er ganske trangt i 10-15B-klassen for øyeblikket. Qwen3 14B, Mistral Small 4 og Llama 3.2 11B Vision er alle sterke alternativer med delvis overlappende funksjonalitet.

Det Gemma 4 12B bringer som de andre ikke har i denne størrelsesklassen er kombinasjonen av bilde + lyd + tekst i én modell, 256K kontekstvindu og native MTP. Det er mye funksjonalitet pakket inn i noe som kjører på 16GB RAM. Lisensen (Apache 2.0) er også renere enn en del konkurrenter – du kan modifisere og distribuere kommersielt uten restriksjoner.

Er det den beste modellen for alle oppgaver? Nei. Er den den beste allround-multimodale modellen du kan kjøre gratis og lokalt i dag på forbrukerhardware? Det ser sterk ut som et ja.

Vil du se hva som er mulig med enda mer minne og en litt annen tilnærming, er Gemma 4-familien for øvrig verdt et blikk – inkludert 1B-modellen for mobilbruk og 27B for de med mer GPU-minne tilgjengelig.

Apache 2.0-lisensen er egentlig underrapportert som nyhet her. Du kan bruke Gemma 4 12B i kommersielle produkter, fine-tune den og distribuere den videre, uten å betale Google en krone. Det er en annen verden enn det var for et par år siden.

Ofte stilte spørsmål

Hvor mye RAM trenger jeg for å kjøre Gemma 4 12B?

Regn med minst 16 GB RAM for en kvantisert versjon, og helst 24-32 GB hvis du vil ha rom til andre programmer samtidig. Har du et grafikkort med 12 GB VRAM eller en Mac med Apple Silicon, går det enda smidigere.

Funker Gemma 4 12B på norsk?

Ja, den håndterer norsk overraskende godt for en åpen modell i denne størrelsen – både til å forstå og til å skrive. Den er ikke like stødig som de største skymodellene, men til daglig tekstarbeid på norsk holder den lenge.

Trenger jeg grafikkort, eller går det på vanlig CPU?

Du kan kjøre den på CPU alene, men da blir den treg. Et grafikkort eller Apple Silicon gir mange ganger raskere svar. Med Ollama eller LM Studio velger programmet automatisk den beste maskinvaren du har.

Kan jeg bruke Gemma 4 12B i et kommersielt produkt?

Ja. Apache 2.0-lisensen lar deg bruke, endre, fine-tune og distribuere modellen i kommersielle produkter uten å betale Google. Les lisensteksten selv før lansering, men terskelen er lav sammenlignet med mange andre modeller.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre styrer et digitalt kontrollpanel omgitt av Claude AI-symboler og glødende lysstriper i et mørkt rom

Claude AI – pris, funksjoner og norsk guide (2026)

Alt om Claude AI i 2026 – priser i norske kroner, Claude Pro vs Max, Claude Code, og ærlig sammenligning med ChatGPT. Komplett norsk guide fra en som bruker Claude daglig.
Jan Sverre med headphones og lydmikser i boardroom-møte med forvirrede executives

Suno AI Copyright 2026 – Opphavsrett og Rettigheter for AI-Musikk

Kan du tjene penger på Suno-musikk? Her er en praktisk gjennomgang av rettigheter, risiko og hva du bør avklare før publisering.
Jan Sverre blar gjennom en tilpasset YouTube AI-videofeed på telefonen

YouTube lar deg lage din egen AI-videofeed – slik fungerer det

YouTube lar deg nå beskrive hva du vil se med vanlig tekst, og AI setter opp en personlig feed for deg. Her er hva du trenger å vite – og hva det egentlig betyr for deg som bruker.
Jan Sverre profesjonelt fotograf-kvalitet portrett AI-generert bildegenerering

Google NotebookLM

Google NotebookLM er en AI-assistent som gjør dokumenter om til interaktive samtaler, studieguidere og podcasts på norsk. Nå drevet av Gemini 3 Pro med nye funksjoner som infographics, slide decks og Deep Research. Komplett guide til gratis vs. Plus-versjon.