Hva er Ollama? Kort sagt er det et gratis verktøy som lar deg laste ned og kjøre AI-modeller lokalt på din egen PC. Du kan chatte i terminalen, koble modellen til andre programmer eller bruke det lokale API-et, uten at selve forespørselen må sendes til en ekstern AI-tjeneste.

Det betyr ikke at du trenger en RTX 4090. En liten modell kan kjøre på en vanlig laptop med CPU og nok RAM, mens større modeller blir langt raskere med et støttet grafikkort. Apple Silicon bruker Metal, Nvidia har bred CUDA-støtte, og AMD fungerer gjennom ROCm eller Vulkan på maskinvare og operativsystemer som Ollama støtter.

Jeg har en RTX 4090 med 24 GB VRAM og kjører AI hovedsakelig fra kommandolinjen på Linux. Det gjør at jeg kan prøve ganske store lokale modeller, men poenget med Ollama er egentlig ikke å kjøpe det dyreste kortet. Poenget er at du kan begynne med maskinen du allerede har, velge en modell som faktisk passer og finne ut om lokal AI løser oppgaven din.

Hva er Ollama?

Ollama er både en modellbehandler og en lokal kjøretjeneste for AI-modeller. Programmet håndterer nedlasting, oppstart og bytte mellom modeller, og finnes for Windows, macOS og Linux. Den offisielle hurtigstarten til Ollama viser at du kan åpne en interaktiv meny med kommandoen ollama og starte en modell direkte derfra.

En enkel måte å forstå det på er at Ollama fjerner mye av knotet mellom en modellfil og en fungerende chat. Du slipper å sette opp et eget Python-miljø bare for å prøve en modell. Ollama starter en lokal tjeneste i bakgrunnen, finner modellen du ber om og gjør den tilgjengelig både i terminalen og gjennom et API.

Ollama er likevel ikke selve AI-modellen. Du må fortsatt velge en modell, og kvalitet, språk, lisens, størrelse og maskinkrav varierer. I modelloversikten hos Ollama kan du filtrere etter blant annet vision, tools, thinking og embedding. Se på modellens egen side før du laster ned, for navn og anbefalte varianter endrer seg raskere enn en statisk favorittliste klarer å følge med på.

Hva betyr det at AI-en kjører lokalt?

Lokal AI betyr at modellberegningen skjer på din egen maskin. Når du kjører en lokal modell i Ollama og sender tekst til den lokale adressen, behandles teksten av CPU-en eller GPU-en din. Det gir deg mer kontroll over dataflyten og gjør at du kan bruke modellen uten å betale per melding eller token.

Ollamas personvernerklæring sier at Ollama ikke ser promptene eller dataene dine når du kjører lokalt. Men lokal kjøring er ikke et magisk sikkerhetsstempel. Et webgrensesnitt kan lagre samtaler på disken, en agent kan få tilgang til filer, og et verktøy for nettsøk kan fortsatt sende data ut. Hvis du åpner Ollama-porten mot nettverket uten tilgangskontroll, har du dessuten laget et nytt sikkerhetsproblem helt på egen hånd. Lokal behandling reduserer avhengigheten av en ekstern modellserver, men du må fortsatt kontrollere logger, integrasjoner, nettverk og hvem som har tilgang.

Det er også viktig å skille mellom lokale og skybaserte modeller i dagens Ollama. En modellvariant merket :cloud kjører ikke lokalt selv om kommandoen ser nesten lik ut. For sensitive dokumenter bør du derfor kontrollere modellvarianten og teste oppsettet før du antar at ingenting forlater maskinen. Vil du bygge et privat dokumentoppsett, har jeg en egen gjennomgang av lokal LLM som personlig kunnskapsbase.

Teknisk diagram viser Ollama, lokal datasløyfe, brannmur og avgrenset skytilkobling
Lokal AI behandler modellen på din egen maskin, men logger, integrasjoner og nettverk må fortsatt kontrolleres.

Slik installerer du Ollama på Windows, macOS og Linux

Den tryggeste starten er å bruke den offisielle nedlastingssiden. Der velger du Windows, macOS eller Linux og følger oppskriften for operativsystemet ditt. På Windows og macOS er den vanlige installasjonspakken enklest for de fleste. På Linux viser Ollama denne kommandoen:

curl -fsSL https://ollama.com/install.sh | sh

Et installasjonsscript hentet rett fra nettet er praktisk, men du bør alltid kontrollere at adressen faktisk er ollama.com før du kjører det. Hvis du ikke liker denne typen installasjon, har dokumentasjonen også egne sider for hvert operativsystem. Når installasjonen er ferdig, åpner du terminalen eller PowerShell og skriver:

ollama

Da får du den interaktive menyen. Du kan også starte en bestemt modell med ollama run modellnavn. Jeg bruker med vilje ikke et gammelt modellnavn som fasit her. Finn en aktuell modell i Ollamas søk, velg en størrelse som passer maskinen, og kopier kommandoen fra modellsiden. Det er et par ekstra sekunder som kan spare deg for en foreldet kommando og mange gigabyte feil nedlasting.

Når modellen svarer, avslutter du den interaktive chatten med /bye. Kommandoen ollama list viser hva du har lastet ned, ollama ps viser modeller som kjører, og ollama rm modellnavn fjerner en modell du ikke trenger. Modellfiler kan være store, så den siste kommandoen blir fort mer nyttig enn man skulle tro.

Hvor mye RAM og VRAM trenger Ollama?

Du trenger nok minne til modellfilen, konteksten og litt arbeidsrom. VRAM er raskest når modellen kjøres på GPU, mens system-RAM kan brukes hvis hele modellen ikke får plass på grafikkortet. Da virker den ofte fortsatt, men hastigheten faller. CPU-kjøring er fullt mulig for små modeller, bare med mer venting.

MaskinFornuftig startHva du bør forvente
8 GB system-RAM, ingen egen GPUDe aller minste kvantiserte modelleneGreit for å lære og teste korte oppgaver, men begrenset kvalitet og fart
16 GB system-RAM eller 6-8 GB VRAMSmå modeller, gjerne rundt 3B-8B i Q4Brukbar chat og enkle oppgaver hvis konteksten holdes nøktern
32 GB system-RAM eller 12-16 GB VRAMMellomstore kvantiserte modellerMer rom for kvalitet, kode og lengre kontekst
24 GB VRAM og rikelig system-RAMStørre Q4-modeller eller raskere mindre modellerHøyere fart og flere valg, men ikke ubegrenset kapasitet

Dette er tommelfingerregler, ikke garantier. En 8B-modell i Q4 bruker gjerne langt mindre minne enn samme modell i Q8, og lang kontekst kan spise mye ekstra minne. Arkitektur og multimodale funksjoner påvirker også regnestykket. Se derfor på faktisk nedlastingsstørrelse og modellinformasjon, ikke bare antall parametere.

Ytelsen kan variere kraftig med driver, modell, kvantisering, kontekst og hvor mye som må kjøres på CPU. Mer VRAM gir plass til større modeller, men garanterer ikke at akkurat din modell blir rask eller god. Flere eldre kort kan være et alternativ, slik eksempelet med to RTX 2080 Ti til lokal AI viser, men flere GPU-er betyr også mer oppsett, strømbruk og flere muligheter til å feilsøke på en søndag.

Hva koster det å kjøre Ollama?

Ollamas gratisnivå koster 0 kroner, og kjøring på egen maskinvare er oppgitt som ubegrenset. En lokal modell har derfor ingen pris per token hos Ollama. Betalte skyplaner og ekstra skybruk er noe annet. Har du allerede en egnet PC, kan du prøve lokal AI uten et nytt abonnement. Den mindre morsomme delen er at gratis programvare fortsatt bruker maskinvare, lagringsplass, strøm og tid.

En liten modell på en laptop koster lite å teste, mens en stasjonær maskin med kraftig GPU kan trekke flere hundre watt under tung kjøring. Du bør ikke kjøpe et skjermkort bare fordi et regneark sier at tre år uten et skyabonnement betaler det ned. Lokal AI og en stor skytjeneste er ikke samme produkt: skyen gir tilgang til svært sterke modeller og ferdige tjenester, mens lokal kjøring gir kontroll, fleksibilitet og forutsigbar bruk på din egen maskin.

Regn heller på oppgaven. Hvor ofte skal modellen brukes? Har du maskinvaren allerede? Er dataene sensitive? Hvor mye er tiden til drift og feilsøking verdt? For en enkeltperson som bare stiller noen spørsmål om dagen, kan en nettjeneste være det rimeligste valget. For en utvikler som kjører mange lokale kall, eller en bedrift som vil holde bestemte dokumenter på eget utstyr, kan regnestykket vippe den andre veien.

Jeg ville begynt uten ny maskinvare. Mål fart, kvalitet og minnebruk på den PC-en du har. Først når du vet hvilken modell og arbeidsmengde som faktisk fungerer, har du et reelt grunnlag for å vurdere mer RAM, mer VRAM eller en egen lokal server. Det er billigere å oppdage begrensningen med en liten modell enn etter at et dyrt grafikkort står på skrivebordet.

Fungerer Ollama med Nvidia, AMD, Apple Silicon og CPU?

Ja, men støtten er ikke lik. Ollamas oppdaterte maskinvareoversikt oppgir Nvidia compute capability 5.0 eller nyere. De fleste støttede Nvidia-kort krever driver 550 eller nyere, mens kort med compute capability 5.0 til 6.2 krever driver 570 eller nyere. Det omfatter mange GeForce-generasjoner, men sjekk kortet og driverkravet før du feilsøker selve modellen.

AMD er mer ujevnt. Ollama viser egne lister for ROCm på Linux og Windows, og tilbyr i tillegg Vulkan-støtte for flere GPU-er. Det betyr ikke at alle Radeon-kort får samme fart eller problemfrie drivere. Intel Arc Pro B70 til lokal LLM er et godt eksempel på hvorfor mye VRAM ikke hjelper fullt ut når programvarestøtten er mer krevende.

På Apple Silicon bruker Ollama Metal for GPU-akselerasjon. Det samlede minnet i en Mac gjør at CPU og GPU deler samme minnepool, noe som kan være praktisk for modeller som ellers ville krevd mye separat VRAM. Men en Mac med 8 GB minne blir ikke en stor AI-server av den grunn. Minnet skal også brukes av macOS og andre programmer.

Har du ingen støttet GPU, kan Ollama bruke CPU. Start smått, lukk minnekrevende programmer og forvent lavere hastighet. En treg modell som faktisk svarer er nyttig for å lære arbeidsflyten. En gigantisk modell som gjør maskinen ubrukelig er mest en effektiv måte å varme opp rommet på.

Ulike PC-er viser hvordan RAM, VRAM og maskinvare påvirker Ollama
Ollama kan kjøre på CPU, Nvidia, AMD og Apple Silicon, men modellstørrelsen må passe tilgjengelig minne.

Hvordan velger du riktig modell?

Velg først etter oppgave, deretter etter minne. En liten generell modell kan være fin til korte spørsmål og oppsummering. Koding, vision, embeddings og tool calling krever modeller som faktisk støtter funksjonen. Modelloversikten lar deg filtrere disse egenskapene, så du trenger ikke gjette ut fra et kreativt modellnavn.

Deretter velger du størrelse og kvantisering. Q4 er ofte et fornuftig startpunkt fordi filen blir langt mindre enn originalen, samtidig som modellen beholder mye av kvaliteten. Q5 og Q8 krever mer minne. Lavere kvantisering kan presse en større modell inn på maskinen, men en større og hardt komprimert modell er ikke automatisk bedre enn en mindre modell som passer ordentlig.

Test med dine egne oppgaver. Be modellen oppsummere et dokument du kjenner, forklare en feil i kode, lage strukturert JSON eller svare på norsk. Ikke velg modell fordi en leverandør har vunnet et benchmark. Det interessante er om svaret er riktig, raskt nok og stabilt i jobben du faktisk skal gjøre. Den bredere guiden min til open source AI forklarer også forskjellen mellom åpne vekter, lisens og praktisk frihet.

Slik bruker du det lokale API-et

Ollama er mer enn en chat i terminalen. Etter installasjon er API-et som standard tilgjengelig på http://localhost:11434/api, ifølge Ollamas API-dokumentasjon. Dermed kan et lokalt program sende en prompt til modellen uten en ekstern API-nøkkel.

curl http://localhost:11434/api/generate -d '{
  "model": "MODELLNAVN",
  "prompt": "Forklar lokal AI på tre korte punkter.",
  "stream": false
}'

Bytt MODELLNAVN med en modell du allerede har lastet ned. Ollama har også offisielle biblioteker for Python og JavaScript. Det gjør API-et nyttig til lokale søk, dokumentverktøy, kodeassistenter og automatiseringer. Du kan også koble Ollama til en agent, slik jeg viser i artikkelen om en Ollama-skrivebordsagent som kan utføre oppgaver.

Hold API-et på localhost mens du lærer. Skal andre maskiner få tilgang, bør du bruke brannmur, autentisering foran tjenesten og kryptert forbindelse. Ikke eksponer port 11434 direkte mot internett. En lokal modell er ikke mindre farlig å misbruke bare fordi strømregningen kommer hjem til deg.

Vanlige problemer med Ollama

Modellen er veldig treg. Kjør ollama ps og kontroller om modellen bruker GPU eller har falt tilbake til CPU. På Linux kan en suspendert maskin i enkelte tilfeller miste Nvidia GPU-en til Ollama etter oppvåkning. Sjekk også at modellen ikke er større enn tilgjengelig VRAM og RAM.

Maskinen går tom for minne. Velg en mindre modell eller en mer komprimert variant, reduser kontekstlengden og steng andre tunge programmer. Ikke stirr deg blind på parameterantallet. Nedlastingsstørrelsen og faktisk minnebruk er mer nyttig når du står med en konkret PC.

AMD- eller Intel-kortet blir ikke brukt. Sammenlign kortet, operativsystemet og driveren med Ollamas levende maskinvareliste. ROCm-, Vulkan- og driverstøtte flytter seg, så et gammelt foruminnlegg kan være korrekt for forfatterens versjon og helt feil for din.

Du forventet ChatGPT-kvalitet fra en bitteliten modell. Ollama gjør lokal kjøring enkel, men kan ikke trylle bort forskjellen mellom modeller. Små modeller er raske og billige å kjøre, men gjør oftere faktafeil og mister tråden. Bruk en skyløsning når oppgaven krever kapasitet du ikke har lokalt, eller del arbeidsflyten slik at sensitive data behandles lokalt og tyngre, ufølsomme oppgaver kjøres et annet sted.

Er Ollama riktig for deg?

Ollama passer godt hvis du vil lære hvordan lokale modeller fungerer, behandle data på egen maskin, unngå løpende API-kostnader eller bygge et lokalt verktøy. Det passer også for utviklere som vil ha et enkelt API og kunne bytte modell uten å skrive om hele programmet.

Det passer dårligere hvis du trenger best mulig modellkvalitet uten å tenke på maskinvare, drivere og oppdateringer. Lokal AI har en kostnad selv om programmet er gratis: maskinen, strømmen, lagringsplassen og tiden din. Ollamas vilkår sier at selskapet ikke krever eierskap til innholdet ditt, men det er ikke det samme som en garanti for opphavsrett eller kommersiell bruk. Modellene har egne lisenser, og de må kontrolleres separat.

Min anbefaling er enkel: Installer Ollama, velg én liten aktuell modell og prøv tre oppgaver du faktisk bryr deg om. Hvis kvaliteten holder, kan du gå videre til større modeller, webgrensesnitt eller API. Hvis ikke, har du lært noe nytt uten å kjøpe en RTX 4090 først. Det er en langt bedre start enn å bygge hele maskinen rundt en modell som er gammel før kvitteringen har rukket å bli kald.

Ofte stilte spørsmål

Er Ollama gratis å bruke?

Ja, Ollama kan lastes ned og brukes gratis. Du betaler ikke per lokal melding, men maskinvare, strøm og lagring koster. Kontroller også lisensen til modellen du velger, særlig hvis du skal bruke resultatene kommersielt.

Kan jeg bruke Ollama uten grafikkort?

Ja. Ollama kan kjøre modeller på CPU, men det går vanligvis tregere enn med en støttet GPU. Velg en liten kvantisert modell, sørg for nok system-RAM og start med korte oppgaver før du øker modellstørrelse eller kontekst.

Sender Ollama data til internett?

En lokal modell og det lokale API-et kan behandle forespørsler på maskinen din, men integrasjoner, nettsøk, skymerkede modeller og andre verktøy kan kontakte eksterne tjenester. Kontroller modellvariant, nettverk og logger før du bruker sensitive data.

Hvor stor Ollama-modell kan PC-en min kjøre?

Det avhenger av tilgjengelig RAM eller VRAM, kvantisering, kontekst og modellarkitektur. Sammenlign modellens faktiske filstørrelse med ledig minne og behold arbeidsrom. Hvis modellen ikke får plass på GPU, kan deler havne på CPU og redusere farten.

6 kommentarer
Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre vurderer Claude pris for Free, Pro og Max i 2026

Hva koster Claude AI? Priser for Free, Pro og Max i 2026

Hva koster Claude AI i 2026? Se priser for Free, Pro, Max, Team og API i norske kroner, forstå bruksgrensene og velg planen som passer behovet ditt best.
Jan Sverre utforsker hvordan man kan lage sang med AI i Suno

Lage sang med AI: Det jeg lærte av 150 Suno-låter

Lage sang med AI på norsk: Dette lærte jeg av 150 Suno-låter om tekst, prompts, uttale, pris, gratisbruk og rettigheter før du publiserer din egen musikk.
Jan Sverre med headphones og lydmikser i boardroom-møte med forvirrede executives

Suno AI Copyright 2026 – Opphavsrett og Rettigheter for AI-Musikk

Kan du tjene penger på Suno-musikk? Her er en praktisk gjennomgang av rettigheter, risiko og hva du bør avklare før publisering.
Jan Sverre blar gjennom en tilpasset YouTube AI-videofeed på telefonen

YouTube lar deg lage din egen AI-videofeed – slik fungerer det

YouTube lar deg nå beskrive hva du vil se med vanlig tekst, og AI setter opp en personlig feed for deg. Her er hva du trenger å vite – og hva det egentlig betyr for deg som bruker.