Hvis du vil kjøre en seriøs coding agent på egen maskin, er Laguna S 2.1 en av de mest interessante modellene som har dukket opp denne sommeren. Ikke fordi den vinner absolutt alle benchmarkene, men fordi den kombinerer åpne vekter, langvarig verktøybruk og nok kapasitet til krevende kodearbeid i en pakke som faktisk kan kjøres på én kraftig maskin.

Det betyr ikke en vanlig gaming-PC. Den praktiske lokale varianten krever rundt 128 GB samlet minne, og selve Q4-modellen er omtrent 75 GB. Men det er likevel en ganske dramatisk forskjell fra modeller som i praksis hører hjemme i et rack med flere datasenter-GPU-er.

MarkTechPost omtalte lanseringen 21. juli 2026. Det mest interessante ligger imidlertid i Poolsides egne målinger, åpne kjørelogger og modellfiler: Laguna S 2.1 er bygget for å holde ut i lange oppgaver, kontrollere arbeidet sitt og bruke verktøy over mange steg. Det er denne arbeidsmåten – mer enn ett pent tall på en resultatliste – som gjør modellen verdt å følge.

Hva er Laguna S 2.1?

Laguna S 2.1 er en open-weight Mixture-of-Experts-modell for agentisk koding og langvarig problemløsing. Den har 118 milliarder parametere totalt, men aktiverer omtrent 8 milliarder for hvert token, ifølge Poolsides lanseringsartikkel. Det gir mindre regnearbeid per token enn en tett modell på samme totalstørrelse.

Det er viktig å skille mellom aktive parametere og modellen som helhet. Alle ekspertene må fortsatt ligge i minnet, selv om bare en liten del brukes i hvert steg. «8 milliarder aktive» betyr derfor ikke at Laguna S 2.1 har samme maskinvarekrav som en vanlig 8B-modell. Det er regnekostnaden som blir redusert, ikke behovet for å ha vektene tilgjengelige.

Modellen har 256 rutede eksperter pluss én delt ekspert. Arkitekturen veksler mellom global attention og sliding-window attention, og den kan resonnere mellom verktøykall. Laguna S 2.1 er plassert mellom den mindre Laguna XS 2.1 på 33 milliarder parametere og Laguna M.1 på 225 milliarder. Jeg skrev tidligere om de første Laguna-modellene og hvorfor Poolside spesialiserer dem for agentisk kodearbeid.

Poolside sier at modellen gikk fra treningsstart til lansering på under ni uker. Den bruker samme pre-training-data som XS 2.1, mens større modellstørrelse, rettelser i treningskoden og særlig ny post-training står for mye av forskjellen. Det er et nyttig poeng: Dette er ikke bare mer data og flere parametere. Mye av arbeidet er rettet mot at modellen skal verifisere mer, gi opp sjeldnere og ikke erklære seier mens halvparten av testene fortsatt feiler.

Illustrasjon av Laguna S 2.1 med mange eksperter og få aktive parametere
Laguna S 2.1 har 118 milliarder parametere totalt, men aktiverer omtrent 8 milliarder per token. Alle ekspertene må likevel være tilgjengelige i minnet.

Kan modellen virkelig kjøre lokalt?

Ja, men «lokalt» betyr her én maskin med omtrent 128 GB samlet minne, ikke en standard PC med et vanlig skjermkort. Poolsides modellkort for den kvantiserte varianten oppgir at Q4_K_M-utgaven er rundt 75 GB og kan kjøres med Ollama på en NVIDIA DGX Spark eller en Apple Silicon Mac Studio.

Poolside målte omtrent 12,6 tokens i sekundet på DGX Spark og 17,6 tokens i sekundet på Apple Silicon. Det er ikke lynraskt, men det er brukbart for en coding agent som jobber i bakgrunnen. På Spark kan den raskere NVFP4-ruten med vLLM og DFlash komme opp i rundt 22-24 tokens i sekundet på kode, men oppsettet er betydelig mer krevende enn én Ollama-kommando.

BF16-versjonen trenger omtrent 236 GB bare til vektene og må fordeles over flere GPU-er. Q8-utgaven er rundt 128 GB og krever mer enn 128 GB systemminne når resten av kjøringen tas med. På en 128 GB-maskin er det derfor Q4-varianten som er realistisk.

Dette er fremdeles dyr og ganske spesiell maskinvare. Likevel er poenget viktig: En modell med denne typen agentkapasitet er ikke lenger låst til en ekstern API-leverandør eller en server med flere H100- og H200-kort. Bedrifter som trenger lokal kjøring, kontroll over kodebasen eller forutsigbar kapasitet får et reelt nytt alternativ.

Hva har Laguna S 2.1 faktisk gjort?

De mest interessante eksemplene er lange oppgaver der modellen må bygge, måle og korrigere underveis. Poolside publiserte tre uredigerte kjørelogger. I den ene bygget Laguna S 2.1 en enkel HTML- og CSS-motor fra en tom mappe i løpet av 181 steg og 50 minutter, uten menneskelig hjelp.

Oppgaven var mer krevende enn å spytte ut en nettside. Modellen laget tokenizer, DOM-struktur, CSS-parser, cascade, layout og en Canvas 2D-renderer. Deretter brukte den headless Chromium som fasit og sammenlignet gjengivelsen numerisk. Det interessante her er ikke at den «bygget en nettleser» – formulert sånn blir det fort reklame – men at den fant en metode for å kontrollere resultatet selv da den manglet syn.

I en annen kjøring fikk modellen arbeide med Poolsides eget agent-harness. Etter flere forsøk endte den på 5,2 prosent raskere kjøring og omtrent 70 prosent færre minneallokeringer. Endringene omfattet blant annet å erstatte ineffektiv strengkonkatenering med buffere og redusere unødvendig kopiering. Poolside kjørte race detector, go vet og funksjonstester på sluttresultatet.

Dette er leverandørens egne demonstrasjoner, ikke uavhengige produkttester. Men de viser hva modellen er trent for: å jobbe lenge, lese tilbakemeldinger fra miljøet og fortsette etter at den første løsningen bare er halvveis god. For meg er det mer nyttig enn enda en kort kodeoppgave der alle toppmodellene allerede scorer nær taket.

Hva sier benchmarkene – og hva sier de ikke?

Poolside rapporterer 78,5 prosent på SWE-Bench Multilingual. I selskapets tabell ligger Laguna S 2.1 også høyt på Terminal-Bench 2.1, SWE-Bench Pro og DeepSWE sammenlignet med flere langt større modeller.

Det ser lovende ut for størrelsen, men leverandørmålinger er ikke en fasit på hvilken modell som skriver best kode for deg. Poolside opplyser selv at resultatene kan komme fra leverandøren, benchmark-eieren eller en tredjepart, og at høyeste rapporterte resultat brukes. På DeepSWE ble Laguna kjørt i Poolsides eget harness, mens mange av konkurrentene er målt med mini-swe-agent. Da er ikke sammenligningen helt ren.

Agent-benchmarker måler dessuten hele systemet rundt modellen: prompt, verktøy, tidsgrenser, antall forsøk og hvor mye modellen får tenke. En modell kan være glimrende i harnesset den er trent tett mot og snuble i et annet verktøyformat. Poolside er uvanlig åpne om denne risikoen og har publisert kjøreloggene fra den endelige evalueringen, slik at andre kan se hva som faktisk skjedde.

Den nøkterne lesningen er derfor at Laguna S 2.1 ser svært konkurransedyktig ut i sin vektklasse, særlig på langvarige terminal- og kodeoppgaver. Om den er bedre enn en lukket toppmodell i ditt prosjekt, vet vi først når folk har kjørt begge med samme agent, samme oppgave og samme budsjett.

Illustrasjon av hvordan verktøy og testoppsett påvirker Laguna S 2.1-benchmarker
Agentbenchmarker måler både modellen og systemet rundt den. Verktøy, harness, tidsgrenser og tokenbudsjett kan endre resultatene betydelig.

Én million tokens kommer med en hake

Laguna S 2.1 er trent for kontekster på opptil 1 048 576 tokens, men de kvantiserte modellfilene leveres normalt konfigurert for 262 144 tokens. Poolside anbefaler 256K-oppsettet for best kvalitet og advarer om at 1M-konfigurasjonen kan gi svakere resultater.

Det er en viktig presisering når «én million tokens» står øverst i lanseringsmaterialet. Du kan aktivere hele vinduet, og Poolside tilbyr også en egen hosted variant med 1M-kontekst. Men det er ikke dermed sagt at du bør helle en hel kodebase inn i prompten og regne med at alt blir bedre. Lang kontekst koster minne, tid og oppmerksomhet.

Thinking-modusen viser den samme avveiningen. Poolside fikk tydelig bedre resultater på både Terminal-Bench og DeepSWE med maksimal thinking, men på DeepSWE brukte modellen i gjennomsnitt godt over dobbelt så mange completion-tokens. Den kan altså jobbe seg fram til bedre løsninger, men bruker mye mer tid og kapasitet på veien.

Laguna S 2.1 har foreløpig bare thinking av eller maks. Du får ikke velge lav, middels eller høy innsats. For kompliserte oppgaver kan utholdenheten være hele poenget. For en liten feilretting kan den samme egenskapen bli overtenking med svært lang ventetid.

Hvor åpen er Laguna S 2.1?

Vektene er tilgjengelige i BF16, FP8, INT4, NVFP4, GGUF og MLX-varianter. Poolside har også sluppet DFlash-modeller for raskere speculative decoding, og modellen støttes av blant annet vLLM, SGLang, Transformers, TRT-LLM, llama.cpp og Ollama.

Lisensen er OpenMDW-1.1. Den gir i utgangspunktet rett til å bruke, endre og distribuere modellmaterialet til både kommersielle og ikke-kommersielle formål. OpenMDW beskriver lisensen som modelltilpasset og tillatende, med krav om at lisens- og opphavsmerknader følger med ved distribusjon.

«Open-weight» er likevel den mest presise betegnelsen. Lisensen tvinger ikke Poolside til å publisere alle treningsdata eller alle delene av treningsprosessen. Du får modellvektene og et ganske bredt bruksrom, men ikke nødvendigvis alt som trengs for å gjenskape modellen fra bunnen av.

For den som vil koble en lokal modell til en coding agent, er økosystemstøtten minst like viktig som lisensordet. Laguna S 2.1 kan brukes gjennom blant annet OpenCode og Cline. OpenRouter tilbyr et gratis endepunkt med 256K kontekst og en betalt variant med hele 1M-vinduet. Modellen passer dermed inn i flere eksisterende arbeidsflyter uten at du må bygge hele agentlaget selv. Den utviklingen henger godt sammen med SmallCode og andre forsøk på å få lokale modeller til å fungere bedre i coding agents.

Begrensningene er ikke pynt med liten skrift

Poolside oppgir tre kjente problemer. Modellen kan overtilpasse seg verktøyformatet i Poolsides eget harness og bruke feil skjema første gang den møter et lignende verktøy hos en tredjepart. Den kan også lage ugyldig JSON i nestede verktøykall, særlig når et argument forventer en liste.

Det tredje problemet er overtenking. Modellen kan bruke lange sekvenser på å resonere før den gjør konkret framgang. Det passer dårlig hvis du trenger raske, små endringer og godt forutsigbar responstid. At en agent aldri gir opp høres flott ut helt til den har tygget tokens i en time på noe som burde tatt fem minutter.

Maskinvarekravet er også en reell terskel. En DGX Spark eller en Mac Studio med 128 GB er én maskin, men det er ikke folkelig hjemmemaskinvare. Har du en RTX 4090 med 24 GB VRAM, er den mindre Laguna XS 2.1 eller en annen kompakt modell et mer realistisk utgangspunkt.

Laguna S 2.1 bør derfor ikke omtales som en ny universell kodekonge. Den er en spesialisert modell for folk som verdsetter lokal kontroll, åpne vekter og lange agentløp – og som har maskinvaren, tiden og kompetansen til å drifte den.

Hvem er Laguna S 2.1 for?

Den tydeligste målgruppen er utviklingsteam, AI-laboratorier og teknisk sterke enkeltbrukere som vil kjøre lange kodeoppgaver lokalt. Den kan også være interessant for bedrifter som ikke ønsker å sende en privat kodebase til en ekstern modell, men som fortsatt vil bruke en moderne coding agent.

For de fleste vil hosted tilgang være den enkleste måten å prøve modellen på. Da slipper du å kjøpe en 128 GB-maskin og bruke tid på kvantisering, serveroppsett og tuning. Lokal kjøring blir mest interessant når personvern, kontroll, fast kapasitet eller mange lange jobber forsvarer arbeidet.

Det Poolside har fått til er likevel verdt å merke seg. Laguna S 2.1 viser at en agentisk kodemodell ikke trenger billioner av parametere for å gjøre krevende arbeid over mange steg. Den virkelige testen kommer nå: om modellen fortsatt er like utholdende og presis når den møter rotete kodebaser, andre verktøy og brukere som ikke har rigget benchmarken.

Ofte stilte spørsmål

Kan Laguna S 2.1 kjøre på en vanlig PC?

Ikke i en praktisk standardkonfigurasjon. Q4-utgaven er omtrent 75 GB, og Poolside anbefaler rundt 128 GB samlet minne. En NVIDIA DGX Spark eller Mac Studio med 128 GB kan kjøre den, mens en vanlig PC med 16-32 GB RAM eller ett 24 GB-skjermkort blir for liten.

Er Laguna S 2.1 gratis å bruke?

Modellvektene kan lastes ned og brukes under OpenMDW-1.1, også kommersielt, så lenge lisensvilkårene følges. Lokal kjøring krever selvfølgelig maskinvare og strøm. OpenRouter har et gratis endepunkt med 256K kontekst og en betalt variant med hele 1M-vinduet.

Har Laguna S 2.1 virkelig én million tokens kontekst?

Modellen er trent for opptil 1 048 576 tokens, men de kvantiserte utgavene leveres normalt med 262 144 tokens aktivert. Poolside anbefaler 256K for best kvalitet og advarer om mulig kvalitetsfall når hele 1M-vinduet slås på.

Er Laguna S 2.1 bedre enn de største lukkede kodemodellene?

Det er ikke dokumentert generelt. Poolsides målinger viser gode resultater i modellens vektklasse, men lukkede toppmodeller leder flere av testene. Harness, tokenbudsjett og verktøy påvirker agentresultater kraftig, så den mest relevante sammenligningen er samme oppgave i samme oppsett.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre styrer et digitalt kontrollpanel omgitt av Claude AI-symboler og glødende lysstriper i et mørkt rom

Claude AI – pris, funksjoner og norsk guide (2026)

Alt om Claude AI i 2026 – priser i norske kroner, Claude Pro vs Max, Claude Code, og ærlig sammenligning med ChatGPT. Komplett norsk guide fra en som bruker Claude daglig.
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.