Innhold Vis
Kimi K3 kan nå lastes ned, men 1,56 TB med modellvekter gjør «lokal AI» til et ganske relativt begrep. Moonshot AI lovet å slippe vektene 27. juli 2026, og denne gangen ble løftet faktisk innfridd.
Det er viktigere enn enda en modellannonsering. Andre kan nå undersøke, tilpasse og drifte Kimi K3 uten at alle forespørsler må gå gjennom Moonshots eget API. Samtidig er dette ikke en modell folk flest legger inn på spill-PC-en i løpet av ettermiddagen. Selve nedlastingen er større enn mange komplette PC-er har lagringsplass til.
Jeg har allerede skrevet om hva Kimi K3 kan gjøre og hvordan den utfordrer Claude og GPT. Den nye hendelsen er mer konkret: Vektene ligger nå på Hugging Face. Spørsmålet er derfor ikke om K3 ser sterk ut i en tabell, men hvem som faktisk kan ta kontroll over modellen nå.
Hva har Moonshot faktisk sluppet?
Moonshot har publisert de komplette Kimi K3-vektene som 96 Safetensors-filer på til sammen 1,56 TB. Fillisten på Hugging Face viser at de fleste delene er rundt 16,6 til 17 GB hver, i tillegg til konfigurasjon, prosessorkode og dokumentasjon.
Kimi K3 er en Mixture of Experts-modell med 2,8 billioner parametere totalt. For hvert token aktiveres 16 av 896 eksperter, slik at omtrent 104 milliarder parametere brukes i selve beregningen. Det er en smart måte å få mye kapasitet uten å regne gjennom alle 2,8 billioner parametere for hvert ord modellen produserer.
Men her kommer detaljen som er lett å misforstå: 104 milliarder aktive parametere betyr ikke at resten kan slettes. Ulike tokens kan sendes til ulike eksperter, og hele samlingen må derfor være tilgjengelig når modellen kjører. Den sparsomme arkitekturen reduserer beregningsarbeidet. Den gjør ikke vektpakken liten.
Dette er også grunnen til at selve publiseringen betyr noe selv om du aldri kommer til å laste ned filene. Vektene gjør det mulig for forskningsmiljøer, skyleverandører og selskaper med stor nok infrastruktur å kontrollere modellen, lage egne varianter og tilby konkurrerende drift. Moonshot er ikke lenger den eneste tekniske portvakten.
Kan Kimi K3 kjøres på en vanlig PC?
Nei, ikke den publiserte Kimi K3-pakken på en måte som gir mening for folk flest. Vektene alene tar 1,56 TB, og kjøring krever i tillegg minne til blant annet runtime, aktiveringer og kontekst. Moonshot anbefaler vLLM, SGLang eller TokenSpeed som inferensmotorer, men oppgir ikke et enkelt forbrukeroppsett i det offisielle modellkortet.
Størrelsen merkes allerede før første token. Med en stabil gigabitlinje tar 1,56 TB rundt tre og en halv time å overføre i en teoretisk verden uten protokolltap, kø eller andre flaskehalser. På 100 Mbit/s snakker vi om nærmere 35 timer. Deretter må filene få plass både under nedlasting og i oppsettet som faktisk skal brukes.
Én kraftig GPU løser ikke dette. Selv et skjermkort med mye minne dekker bare en liten del av 1,56 TB. Modellen må i praksis fordeles over mange akseleratorer eller kjøres med omfattende avlasting til systemminne og lagring. Det siste kan være teknisk mulig i eksperimenter, men «starter» og «brukbar hastighet» er to helt forskjellige mål.
Det betyr ikke at utgivelsen er irrelevant for lokale modeller. Tvert imot. Nå kan miljøene rundt llama.cpp, vLLM og andre inferensmotorer studere arkitekturen, prøve nye kvantiseringer og finne smartere måter å fordele ekspertene på. Hugging Face viser allerede flere avledede kvantiseringer. Men ingen komprimering tryller bort at utgangspunktet er 2,8 billioner parametere.
Er ikke modellen allerede kvantisert?
Jo. Kimi K3 er trent med MXFP4-vekter og MXFP8-aktiveringer fra finjusteringsfasen. Moonshots tekniske dokumentasjon beskriver dette som kvantiseringsbevisst trening for bredere maskinvarestøtte. Pakken på 1,56 TB er altså ikke en vanlig fullpresisjonsmodell som bare venter på den åpenbare 4-biterskuren.
Fire bits ganger 2,8 billioner parametere gir grovt regnet 1,4 TB før metadata, skalaer og andre deler av modellen legges til. Da ser 1,56 TB ganske logisk ut. Det setter også forventningene: En ny 4-biterskonvertering kan gi bedre kompatibilitet med bestemte motorer, men den vil ikke nødvendigvis halvere størrelsen.
Mer aggressiv kvantisering kan kutte videre, men da kommer avveiningen mellom størrelse, fart, maskinvarestøtte og kvalitet. K3 er dessuten en ny arkitektur med Kimi Delta Attention, Attention Residuals og 896 eksperter. Det holder ikke at et filformat kan lagre vektene. Inferensmotoren må forstå og kjøre hele arkitekturen effektivt.
For hjemmebrukere er derfor mindre modeller fortsatt det realistiske valget. K3-vektene er først og fremst en ressurs for dem som bygger infrastruktur, forsker på store sparsomme modeller eller vil tilby K3 gjennom en tjeneste. Å kalle den lokal er teknisk riktig. Å kalle den en lokal modell for vanlige brukere blir mer reklame enn virkelighet.
Er Kimi K3 open source?
Kimi K3 er en open-weight-modell med en egen Kimi K3-lisens, ikke en vanlig MIT-lisens. Moonshot bruker selv konsekvent betegnelsen open weight. Det er presist: Vektene og koden kan lastes ned, brukes, endres og distribueres, men kommersiell bruk har særvilkår som gjør «open source» til en for romslig merkelapp.
Den publiserte Kimi K3-lisensen har to terskler store aktører bør lese nøye. En virksomhet som tilbyr «Model as a Service» og har mer enn 20 millioner dollar i samlet omsetning gjennom en periode på 12 måneder, må inngå en separat avtale med Moonshot før kommersiell bruk. Med dollarkursen 27. juli tilsvarer det omtrent 193 millioner kroner.
Det finnes også et krav om synlig Kimi K3-navn i kommersielle produkter eller tjenester med over 100 millioner månedlige aktive brukere eller mer enn 20 millioner dollar i månedlig omsetning. Intern bruk er unntatt fra disse to bestemmelsene, og det samme gjelder bruk gjennom Moonshots egne produkter eller sertifiserte inferenspartnere.
For en student, hobbyutvikler eller vanlig SMB er tersklene så høye at de neppe får noen praktisk betydning. For en stor API-leverandør er saken en annen. Da er ikke vektene en blankofullmakt til å konkurrere med Moonshot på hvilke vilkår som helst. Åpne filer og fri kommersiell bruk er ikke det samme.
Hva endrer utgivelsen for utviklere?
Utgivelsen gir utviklere flere reelle leverandørvalg. K3 kan nå driftes av andre enn Moonshot, kontrolleres i egne miljøer og bygges inn i løsninger der data ikke bør sendes til modellprodusentens API. Det er særlig interessant for større virksomheter som både har infrastrukturen og behovet for mer kontroll.
For de fleste vil API fortsatt være den fornuftige inngangen. Jeg har tidligere gått nærmere inn på prisen og den praktiske oppførselen til Kimi K3. OpenRouter oppgir nå en listepris på 3 dollar per million input-tokens og 15 dollar per million output-tokens, omtrent 29 og 145 kroner med siste kontrollerte dollarkurs. Kimi K3 er allerede tilgjengelig via OpenRouter, så du trenger ikke eie et lite datasenter for å prøve modellen.
For et mer praktisk eksempel fra samme modellfamilie har jeg også testet Kimi K2.7 Code i en reell kodeoppgave. K3-utgivelsen er i en helt annen størrelsesklasse, men erfaringen viser hvorfor tilgang gjennom OpenRouter fortsatt er den nyttigste inngangen for de fleste.
Jeg ville likevel skilt tydelig mellom å teste modellen og å gi den sensitive bedriftsdata. Jeg er generelt skeptisk til kinesiske AI-modeller når data sendes til en ekstern tjeneste. Egen drift kan redusere den bekymringen, men da må virksomheten både håndtere en modell på 1,56 TB og forstå den særskilte lisensen. Kontroll har en pris, også når selve vektene kan lastes ned gratis.
Utgivelsen kan også gi bedre prispress. Når flere leverandører kan drifte samme modell, blir konkurransen mindre avhengig av Moonshots egen kapasitet og prisliste. Det er en av de viktigste gevinstene ved åpne vekter: Du trenger ikke være i stand til å kjøre modellen hjemme for å få nytte av at andre kan gjøre det.
Hvorfor er denne utgivelsen viktig?
Kimi K3 viser hvor langt open-weight-retningen er kommet, men også hvor den møter en fysisk grense. En modell kan være tilgjengelig for nedlasting uten å være tilgjengelig i praksis for vanlige utviklere. Her er terskelen 1,56 TB, komplisert ekspertfordeling og infrastruktur i datasenterklassen.
Det gjør ikke lanseringen mindre verdifull. Forskere kan undersøke vektene. Leverandører kan bygge egne tjenester. Bedrifter med reelle krav til datakontroll kan vurdere egen drift. Og konkurrentene kan lære av en arkitektur som kombinerer 2,8 billioner totale parametere med bare 104 milliarder aktive per token.
Samtidig bør vi være nøyaktige med ordene. K3 er ikke «gratis Claude på din laptop». Den er heller ikke open source i den enkle MIT-betydningen. Det Moonshot faktisk har levert er en enorm open-weight-modell som kan kontrolleres og driftes utenfor selskapets API, dersom du har maskinvaren, kompetansen og en bruk som passer lisensen.
Det er en viktig milepæl. Bare ikke forveksle en åpen dør med en lav terskel.
Ofte stilte spørsmål
Hvor stor er nedlastingen av Kimi K3?
Kimi K3-vektene er 1,56 TB fordelt på 96 Safetensors-filer. De fleste filene er rundt 16,6 til 17 GB. Du trenger i praksis mer kapasitet enn dette fordi kjøring også krever plass og minne til programvare, kontekst og andre runtime-data.
Kan Kimi K3 kjøres på ett skjermkort?
Ikke den komplette publiserte modellen på en praktisk måte. Vektene alene er 1,56 TB, langt mer enn minnet på ett vanlig skjermkort. Reell drift krever mange akseleratorer eller tung avlasting til systemminne og lagring, med en sannsynlig kraftig fartsstraff.
Er det gratis å bruke Kimi K3-vektene kommersielt?
Lisensen tillater mye kommersiell bruk, men har særvilkår for store aktører. «Model as a Service»-virksomheter med mer enn 20 millioner dollar i omsetning over 12 måneder må inngå en separat avtale med Moonshot. Store forbrukertjenester kan også få krav om synlig attribusjon.
Må jeg laste ned vektene for å prøve Kimi K3?
Nei. Kimi K3 kan brukes gjennom Moonshots tjenester og tredjepartsleverandører som OpenRouter. Det er den mest realistiske løsningen for vanlige utviklere. De åpne vektene er først og fremst nyttige for forskning, egen drift, tilpasning og konkurrerende skytjenester.