Hvis du vil kjøre en AI-agent lokalt, er MiniCPM5-2B en modell det er verdt å følge med på. Den har 2,52 milliarder parametere, et kontekstvindu på 131 072 tokens og er trent spesielt for kode, verktøykall og agentoppgaver. Det er mye kapasitet presset inn i en ganske liten modell.

OpenBMB slapp modellen 7. september og hevder at den i gjennomsnitt slår flere modeller i 4B-klassen. Det høres voldsomt ut, men det er ikke gjennomsnittstallet på 53,9 som gjør lanseringen spennende. Den virkelige saken er at små modeller begynner å bli bygget for faktisk arbeid lokalt – ikke bare enkel chat og tekstfullføring.

Resultatene har samtidig en tydelig slagside. Modellen ser sterk ut på verktøybruk, kode og enkelte agentoppgaver, mens ren faktakunnskap og noen lange konteksttester er svakere. Dette er derfor ikke en liten universalmodell som skal erstatte alt. Det er et mer målrettet verktøy, og det er nettopp derfor jeg synes den er interessant.

Hva er MiniCPM5-2B?

MiniCPM5-2B er en tett kausal språkmodell med nøyaktig 2 516 756 480 parametere, 42 lag og 131 072 tokens innebygd kontekst. Ifølge det offisielle modellkortet er 1 981 982 720 av parameterne utenfor embedding-laget. Modellen bruker grouped-query attention med 16 query-hoder og 2 key/value-hoder.

Arkitekturen er standard LlamaForCausalLM. Det høres kanskje ut som en tørr detalj, men for alle som faktisk skal kjøre modellen er det gode nyheter. OpenBMB har ikke laget en sær løsning som krever egne kjerner eller en spesialbygd fork av modellkoden. De vanlige motorene kan laste den.

Dette er den andre modellen i MiniCPM5-serien og en reell oppskalering fra MiniCPM5-1B med reasoning og tool use. 1B-utgaven viste retningen. 2B-utgaven har mer enn dobbelt så mange totale parametere og er ment for lokale assistenter, kodingsagenter, verktøybaserte arbeidsflyter og reasoning der lav ressursbruk betyr noe.

Hvorfor er agentdelen viktigere enn snittscoren?

MiniCPM5-2B scorer 53,9 i gjennomsnitt i OpenBMBs egen brede sammenligning, foran alle de større referansemodellene selskapet tok med. Men et gjennomsnitt på tvers av alt fra kunnskap og matematikk til søkeagenter kan skjule mer enn det forklarer. Tabellen er publisert av OpenBMB, og mange av resultatene er gjenskapt internt av selskapet.

De nyttigste utslagene kommer i mer konkrete oppgaver. Modellen ser særlig sterk ut på kode, programvareoppgaver og verktøybruk, og den slår den større Qwen-referansen på flere av disse testene. Dette er fortsatt leverandørpubliserte målinger, ikke en garanti for at agenten din håndterer kundesystemet eller kodebasen uten å rote.

Likevel peker resultatene i samme retning: OpenBMB har prioritert oppgaver der modellen må bruke verktøy, navigere arbeidsflyter og produsere kode. Det er mer relevant enn at en liten modell kan svare på flest mulig quizspørsmål. En lokal agent trenger ikke vite alt hvis den kan finne riktig informasjon, kalle riktig funksjon og følge en oppgave uten å gå seg vill.

Kompakt lokal AI-modell kobler kode, funksjonskall og verktøy i én arbeidsflyt
MiniCPM5-2B er mest interessant når den bruker kode og verktøy i en avgrenset lokal arbeidsflyt.

Hvor er MiniCPM5-2B fortsatt svak?

MiniCPM5-2B er ikke best på alt. Den større Qwen-referansen ligger foran på både MMLU-Pro og Humanity’s Last Exam i OpenBMBs tabell. Større modeller har fremdeles en fordel når oppgaven krever bred faktakunnskap og mye lagret verdensforståelse.

Lang kontekst er heller ikke én enkelt egenskap som kan oppsummeres med tallet 131 072. MiniCPM5-2B gjør det sterkt på NoLiMa, men taper mot Qwen-referansen på AA-LCR og LongBench v2. Et stort kontekstvindu forteller hvor mye modellen kan ta inn. Det forteller ikke automatisk hvor godt den finner og bruker den riktige detaljen langt inne i materialet.

Forskjellene innad i agenttestene er også store. Qwen-referansen er klart foran på Terminal-Bench, mens Granite-modellen så vidt vinner Claw-Gym. MiniCPM5-2B har altså ikke knekt agentarbeid som én samlet disiplin. Den har noen svært sterke ferdigheter og noen tydelige hull, akkurat som man bør forvente i denne størrelsesklassen.

Modellkortet advarer også om unøyaktige, skjeve eller støtende svar og sårbarhet for jailbreaks. Det er standardtekst, men ekstra viktig når en modell får verktøy. En agent som kan utføre handlinger trenger avgrensede rettigheter, validering og logging. En god benchmarkscore er ikke et sikkerhetssystem. Punktum.

Hvordan fikk OpenBMB så mye inn i 2,52 milliarder parametere?

Treningsopplegget består av basislæring, mid-training og tre trinn med post-training: SFT, RL og on-policy distillation, forkortet OPD. OpenBMB oppgir at SFT-trinnet brukte 400 milliarder tokens med materiale for deep thinking før egne RL-lærere ble trent for matematikk, kode, agentoppgaver, skriving og beslektede områder.

Deretter destilleres 16 ekspertmodeller, hvorav 5 er rettet mot agenter, tilbake til ett checkpoint. Tanken er ganske elegant: ekspertene får rendyrke ulike ferdigheter, mens sluttmodellen prøver å samle dem uten at brukeren må laste og rute mellom 16 modeller. OpenBMB rapporterer at RL og OPD gir tydelige gjennomsnittlige løft for både generelle oppgaver og agentarbeid.

Her fortjener OpenBMB faktisk ros for mer enn en resultatgraf. Teamet har publisert base-, mid-training- og SFT-checkpoints i tillegg til sluttmodellen. Flere av datasettene bak treningen er også tilgjengelige, blant annet 500 000 agenteksempler og over 80 000 RL-eksempler. Det gjør det mulig for andre å undersøke hva hvert trinn tilfører, i stedet for å få en ferdig modell og en bunke markedsføring.

Det betyr ikke at hele treningsløpet kan gjenskapes med et par kommandoer. Datakuratering, regnekraft, læreroppsett og evalueringsvalg betyr fortsatt mye. Men publiserte mellomsteg gjør påstanden om effekten av RL og OPD mer kontrollerbar. Forskere kan sammenligne base-, SFT- og sluttmodellen på de samme oppgavene og se om gevinstene finnes utenfor OpenBMBs egen tabell.

Hvordan kan modellen kjøres lokalt?

MiniCPM5-2B kommer i flere formater. BF16-versjonen på Hugging Face har en modellfil på omtrent 5,03 GB, mens GGUF-utgaven er laget for llama.cpp, Ollama og LM Studio. Det finnes også 4-bit MLX for Apple Silicon og en 4-bit GPTQ-variant. Hvor mye minne du trenger i praksis avhenger av format, kvantisering, kontekstlengde og backend.

Her er det lett å gå i en klassisk felle: En liten modellfil betyr ikke at du kan fylle hele kontekstvinduet gratis. KV-cache og andre deler av kjøringen bruker mer minne når samtalen eller dokumentmengden vokser. Start med en realistisk kontekst for oppgaven, mål faktisk ressursbruk og øk bare når du trenger det. 131 072 tokens er en øvre kapasitet, ikke en anbefalt standardinnstilling for hver eneste forespørsel.

Vil du ha et lokalt OpenAI-kompatibelt endepunkt, oppgir OpenBMB vLLM 0.21 eller nyere som en direkte vei:

pip install "vllm>=0.21"
vllm serve openbmb/MiniCPM5-2B --port 8000

For verktøykall anbefaler OpenBMB SGLang 0.5.16 eller nyere. Modellen skriver verktøykall i XML-format, og den innebygde minicpm5-parseren gjør dem om til OpenAI-kompatible tool_calls:

pip install "sglang[srt]>=0.5.16"
python -m sglang.launch_server \
  --model-path openbmb/MiniCPM5-2B \
  --port 30000 \
  --tool-call-parser minicpm5

Transformers fungerer også direkte, og reasoning slås på gjennom enable_thinking=True i chat-templaten. OpenBMB anbefaler temperatur 1,0 og top_p=0.95. GitHub-repositoriet har egne oppskrifter for Transformers, vLLM, SGLang, llama.cpp, Ollama, LM Studio, MLX og flere fine-tuning-rammeverk.

MiniCPM5-2B kjøres lokalt med flere motorer og økende minnebruk ved lang kontekst
MiniCPM5-2B kan kjøres med flere lokale motorer, men lang kontekst øker minnebruken utover selve modellfilen.

Hvem bør faktisk prøve MiniCPM5-2B?

Modellen er mest aktuell for utviklere og nysgjerrige brukere som vil ha lokale kodingsassistenter, dokumentagenter eller avgrensede verktøybaserte arbeidsflyter. Den kan også være relevant for små bedrifter som vil holde data på egen maskin og kan leve med at en liten modell må få tydelige oppgaver og gode rammer.

Jeg har ikke testet MiniCPM5-2B selv ennå, og jeg ville ikke valgt den på grunn av snittscoren alene. OpenBMB har laget sammenligningen, valgt modellene og gjenskapt mange av testene selv. Det riktige er å laste en kvantisert variant, gi den noen representative oppgaver og sammenligne resultat, fart, minnebruk og feilrate med modellen du allerede bruker. Tester du agentarbeid, må du teste hele løkken – verktøyvalg, argumenter, feilhåndtering og sluttresultat.

Dette gjelder særlig for norske oppgaver, som ikke er løftet fram som en dokumentert styrke. En modell kan være glimrende på kode og fortsatt misforstå fagspråk, navn eller instruksjoner på norsk. Begynn derfor med ufarlige og reversible handlinger. Ikke gi en fersk 2,52B-modell frie tøyler i produksjon fordi en blå søyle var høy.

Små modeller får tydeligere jobber

MiniCPM5-2B viser hvor dette segmentet er på vei. Poenget er ikke lenger bare å lage den minste chatboten som klarer en samtale. Små modeller får tydeligere roller som lokale arbeidere: en agent som bruker noen få verktøy, en kodehjelper tett på prosjektet eller en dokumentassistent som ikke sender alt til en ekstern tjeneste.

Det minner om utviklingen jeg beskrev med IBM Granite 4.1 og effektive åpne modeller: rå størrelse forteller stadig mindre alene. Arkitektur, treningsdata, post-training og en tydelig oppgaveprofil avgjør hvor nyttig modellen faktisk blir.

MiniCPM5-2B er derfor en lovende lokal agentmodell, ikke en ny orakelmaskin. Åpne vekter, Apache 2.0-lisens, flere kjøreformater, publiserte datasett og mellomliggende checkpoints gjør den langt mer etterprøvbar enn mange lanseringer. Nå må den bevise at de sterke agentresultatene overlever møtet med ekte kode, ekte verktøy og ekte rot. Det er testen som teller.

Ofte stilte spørsmål

Kan MiniCPM5-2B kjøres med Ollama eller LM Studio?

Ja. OpenBMB har publisert en egen GGUF-utgave for llama.cpp, Ollama og LM Studio. Velg en kvantisering som passer maskinens minne, og husk at lang kontekst øker minnebruken selv om selve modellfilen er liten.

Er MiniCPM5-2B bedre enn Qwen3.5-4B?

Ikke på alt. MiniCPM5-2B har høyere gjennomsnitt i OpenBMBs sammenligning og sterke resultater på kode, verktøy og agenter. Qwen3.5-4B gjør det bedre på blant annet MMLU-Pro og enkelte tester av lang kontekst. Egne oppgaver er en bedre dommer enn snittet.

Kan MiniCPM5-2B brukes kommersielt?

Modellvektene er publisert med Apache 2.0-lisens, som normalt tillater kommersiell bruk, endring og distribusjon på lisensens vilkår. Kontroller likevel lisensen og datasettenes egne vilkår for løsningen du faktisk skal levere.

Er 131 072 tokens det samme som at modellen husker alt?

Nei. Tallet angir hvor mye kontekst modellen kan ta inn, ikke at den bruker alle detaljene like godt. OpenBMBs egne resultater varierer mellom testene for lang kontekst, så retrieval og presisjon bør måles på dokumentene og arbeidsflyten din.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre ved skrivebordet med Claude AI-chat på skjermen

Hva er Claude AI? Komplett guide for nybegynnere (2026)

Hva er Claude AI? En enkel og ærlig guide: hvem som laget det, hvilke versjoner som finnes, hva det koster, og hvordan du kommer i gang i dag.