Innhold Vis
Du trenger ikke lenger en skyserver for å snakke med en AI som forstår bilder og lyd. Gemma 4 12B, som Google slapp 3. juni 2026, er den første mellomstore open weights-modellen med innebygd bilde- og lydforståelse som faktisk kjører på en vanlig 16GB laptop – uten månedlig abonnement, uten å sende data til noen.
Det er en milepæl som kanskje ikke høres så dramatisk ut, men det er det. Frem til nå har multimodal AI – altså modeller som forstår både tekst, bilde og lyd – vært forbeholdt store skytjenester. Gemma 4 12B snur det på hodet. Modellen veier 11,95 milliarder parametere, er lisensiert under Apache 2.0 (fri kommersiell bruk, fri modifisering) og er tilgjengelig dag én via Ollama, LM Studio og llama.cpp.
Hva betyr det i praksis? At du kan sende et bilde av et dokument og spørre «hva står her?», laste inn en lydfil og spørre «kan du oppsummere dette?», eller bruke modellen i en lokal agent-pipeline – alt uten å forlate din egen maskin.
Hva er Gemma 4 12B «Unified»?
Google kaller modellen «Unified» fordi den bryter med den tradisjonelle arkitekturen der tekst, bilde og lyd behandles i separate encodere som deretter kobles sammen. I stedet går alle modaliteter rett inn i språkmodell-backbonen gjennom en felles token-mekanisme.
Bilder behandles via en lett embedding-modul – én matriseoperasjon, positional embedding og normalisering – og projiseres direkte inn i samme dimensjonsrom som tekst-tokens. Lyd tas inn som rå 16kHz signal, kuttes i 40ms-rammer og projiseres på samme måte. Videoer prosesseres som enkeltframes. Det er ingen tung separat vision-encoder her, ingen Whisper-lignende lydmodul boltet på siden.
Resultatet er en arkitektur som er overraskende kompakt til hva den klarer. Modellen har 48 lag og støtter et kontekstvindu på 256 000 tokens – stort nok til å prosessere lange dokumenter, halvlange lydopptak eller sekvenser av bilder i én omgang. Den forstår over 35 språk.

Kjører den faktisk på en vanlig laptop?
Ja – og det er den viktigste nyheten. Gemma 4 12B krever 16GB VRAM eller unified memory for å kjøre komfortabelt. Det betyr at en MacBook Pro M2 eller M3 med 16GB RAM håndterer den uten problemer. Det samme gjelder de fleste Windows-laptoper med en dedikert GPU i mellomklassen som har 16GB VRAM, som en RTX 4080 laptop.
Google oppgir at ytelsen ligger «nær» den langt større Gemma 4 26B MoE-modellen på under halvparten av minnefotavtrykket. Slike sammenligninger skal alltid tas med en klype salt – oppgavetype betyr enormt mye her – men poenget er at du får mye modell for plassen den tar.
For Apple Silicon-brukere spesielt er dette interessant. MLX-støtte er klar fra dag én, og kombinert med optimalisert MTP-inferens på Apple Silicon kan du forvente reell, brukbar hastighet – ikke bare at den «virker» i teorien.
Hva er «native audio input» – og hvorfor er det nytt?
Gemma 4 12B er Googles første mellomstore modell med innebygd lydforståelse. Det betyr at du kan sende en lydfil direkte til modellen og få et svar tilbake – ingen separat transkripsjonssteg, ingen ekstra pipeline med Whisper foran.
Praktisk sett åpner dette for ting som:
- Spørre om innholdet i et møteopptak
- Analysere tonefall eller innhold i en talemelding
- Lage lokale voice-interface-pipelines uten skyavhengighet
- Kombinere lyd og bilde i én spørring («ser du personen som snakker i denne videoen?»)
Det er verdt å understreke at «forståelse» her betyr semantisk analyse, ikke nødvendigvis perfekt transkripsjon. For ren ordrett transkripsjon er dedikerte modeller fortsatt sterkere. Men evnen til å tolke, oppsummere og svare på lyd er en helt annen sak – og der er Gemma 4 12B nå med i leken.
Slik kommer du i gang lokalt
Google har gjort det unødvendig komplisert å finne dokumentasjonen, men veien inn er faktisk enkel. Vektene ligger på Hugging Face og Kaggle. Du trenger en gratis konto for å laste dem ned.
Raskeste vei til å teste modellen er via Ollama:
ollama run gemma4:12b
LM Studio oppdateres løpende og bør ha modellen tilgjengelig fra sin modellkatalog kort tid etter slipp. For llama.cpp og vLLM finnes offisielle instruksjoner i Googles Gemma-dokumentasjon. MLX og Unsloth er støttet for de som vil fine-tune modellen.
Én praktisk observasjon fra tidlig testing: legg bildeinnholdet før tekstspørsmålet i prompten for best resultat. Altså:
[bilde] Hva viser dette bildet?
…i stedet for spørsmål først, bilde til slutt. Det virker å gi mer presise svar fra modellen.

Hva er Multi-Token Prediction, og hva betyr det for deg?
Gemma 4 12B inkluderer MTP-draftere (Multi-Token Prediction) innebygd. I stedet for å generere ett token av gangen kan modellen forutsi og verifisere flere tokens parallelt, noe som reduserer latens merkbart på kompatibel hardware.
llama.cpp fikk MTP-støtte og det er dokumentert at det kan gi opptil 2,4 ganger raskere inferens for modeller som støtter det. Gemma 4 12B er bygget med det inn fra starten, ikke boltet på etterpå. Det betyr at du bør se reell hastighetsforbedring uten tweaking – forutsatt at du bruker et inference-rammeverk som støtter MTP.
For Apple Silicon: MTPLX er spesielt optimalisert for dette og er verdt å se på hvis du kjører på MacBook eller Mac Studio.
Hva med agentic bruk og function calling?
Gemma 4 12B støtter function calling og er bygget for agentic workflows fra starten. Google slipper også et offisielt Skills Repository – en samling ferdige kompetanse-moduler du kan koble inn i modellen for spesialiserte oppgaver.
Det betyr at du kan bygge lokale agenter som kan kalle eksterne API-er, manipulere filer, søke på nettet eller utføre kodeoppgaver – og gjøre det uten å sende en eneste prompt til en skyserver. For de som vil bygge noe som faktisk gjør ting, og ikke bare svarer, er dette vesentlig.
Det er fremdeles tidlige dager for lokal agentic AI, men retningen er klar. Se gjerne den komplette guiden til open source AI for mer kontekst rundt hva som finnes av rammeverk og tilnærminger her.
Gemma 4 12B vs de andre åpne modellene akkurat nå
Det er ganske trangt i 10-15B-klassen for øyeblikket. Qwen3 14B, Mistral Small 4 og Llama 3.2 11B Vision er alle sterke alternativer med delvis overlappende funksjonalitet.
Det Gemma 4 12B bringer som de andre ikke har i denne størrelsesklassen er kombinasjonen av bilde + lyd + tekst i én modell, 256K kontekstvindu og native MTP. Det er mye funksjonalitet pakket inn i noe som kjører på 16GB RAM. Lisensen (Apache 2.0) er også renere enn en del konkurrenter – du kan modifisere og distribuere kommersielt uten restriksjoner.
Er det den beste modellen for alle oppgaver? Nei. Er den den beste allround-multimodale modellen du kan kjøre gratis og lokalt i dag på forbrukerhardware? Det ser sterk ut som et ja.
Vil du se hva som er mulig med enda mer minne og en litt annen tilnærming, er Gemma 4-familien for øvrig verdt et blikk – inkludert 1B-modellen for mobilbruk og 27B for de med mer GPU-minne tilgjengelig.
Apache 2.0-lisensen er egentlig underrapportert som nyhet her. Du kan bruke Gemma 4 12B i kommersielle produkter, fine-tune den og distribuere den videre, uten å betale Google en krone. Det er en annen verden enn det var for et par år siden.
Ofte stilte spørsmål
Hvor mye RAM trenger jeg for å kjøre Gemma 4 12B?
Regn med minst 16 GB RAM for en kvantisert versjon, og helst 24-32 GB hvis du vil ha rom til andre programmer samtidig. Har du et grafikkort med 12 GB VRAM eller en Mac med Apple Silicon, går det enda smidigere.
Funker Gemma 4 12B på norsk?
Ja, den håndterer norsk overraskende godt for en åpen modell i denne størrelsen – både til å forstå og til å skrive. Den er ikke like stødig som de største skymodellene, men til daglig tekstarbeid på norsk holder den lenge.
Trenger jeg grafikkort, eller går det på vanlig CPU?
Du kan kjøre den på CPU alene, men da blir den treg. Et grafikkort eller Apple Silicon gir mange ganger raskere svar. Med Ollama eller LM Studio velger programmet automatisk den beste maskinvaren du har.
Kan jeg bruke Gemma 4 12B i et kommersielt produkt?
Ja. Apache 2.0-lisensen lar deg bruke, endre, fine-tune og distribuere modellen i kommersielle produkter uten å betale Google. Les lisensteksten selv før lansering, men terskelen er lav sammenlignet med mange andre modeller.