Vil du kjøre en AI-agent som kan lese og resonnere over en million tokens uten å krasje eller bli treig? NVIDIA mener de har svaret – og de gir vekter, treningsdata og oppskrifter helt åpent. Det er ikke en liten ting i en bransje der de store spillerne helst beholder magien for seg selv.

Nemotron Ultra er ikke nok en modell du bare leser om og glemmer. Det er en 550 milliarder parameter Mixture-of-Experts-modell med en hybrid arkitektur som kombinerer Mamba-lag og oppmerksomhetslag på en måte som faktisk gir deg noe praktisk: høyere hastighet og lengre kontekst samtidig. De fleste store modeller velger det ene eller det andre. Her er begge deler.

La oss se på hva som faktisk skiller dette fra mengden – og hva det betyr i praksis.

Hva er Nemotron Ultra, og hva gjør den annerledes?

Nemotron Ultra er en åpen Mixture-of-Experts-modell med totalt 550 milliarder parametere, men bare 55 milliarder aktive per token. Det betyr at den ikke bruker hele sin kapasitet på hvert enkelt trinn – den ruter token til de 22 mest relevante ekspertene av totalt 512 i hvert lag. Resultatet er at du får ytelsen til en veldig stor modell til en brøkdel av regnekostnaden.

Det som virkelig skiller Nemotron Ultra fra andre store åpne modeller er arkitekturen. Den kombinerer Mamba-lag – som skalerer sub-kvadratisk med kontekstlengde – med et fåtall vanlige oppmerksomhetslag for presise gjenkallelser. Praktisk konsekvens: du kan ha en million tokens kontekst uten at inferenstiden eksploderer slik den ville gjort med en ren transformer-arkitektur.

Visualisering av Mixture-of-Experts arkitektur med aktive ekspert-ruter i neongrønt
Nemotron Ultra aktiverer 22 av 512 eksperter per token – effektiv ruting gir høyere throughput

Hva er 1 million tokens i praksis?

1 million tokens tilsvarer omtrent 750 000 ord – eller rundt ti romaner. Det er nok til å laste inn hele kodebasen til et middels stort prosjekt, alle møtereferater fra et år, eller et langt juridisk dokument og stille spørsmål om detaljene.

For AI-agenter som kjører over mange runder – planlegger, kaller verktøy, resonnerer – er dette særlig nyttig. Agenten kan holde styr på hele konteksten uten å måtte oppsummere og kaste informasjon underveis. NVIDIA oppnår dette gjennom det de kaller RULER @ 1M tokens-test, der Nemotron Ultra scorer 94,7 av 100. Det er et mål på hvor godt modellen faktisk husker og bruker informasjon fra hele kontekstvinduet.

Vil du lese mer om hva NVIDIA har bygd rundt agenter den siste tiden? Jeg skrev om NemoClaw og NVIDIAs agentplattform tidligere – Nemotron Ultra er den rå modellmotoren som kan ligge under slike systemer.

Hvor mye raskere er den enn konkurrentene?

NVIDIA oppgir at Nemotron Ultra leverer opptil 6x høyere inferens-throughput enn sammenlignbare åpne modeller ved tilsvarende nøyaktighet. På en konkret test med 8 000 tokens inn og 64 000 tokens ut er tallene:

  • 5,9x raskere enn GLM-5.1
  • 4,8x raskere enn Kimi-K2.6
  • 1,6x raskere enn Qwen-3.5

Hva betyr det i praksis? At du kan kjøre langt mer inferens per GPU-time – noe som monner på regningen om du er en bedrift som faktisk bruker modellen i produksjon. De oppnår dette delvis gjennom NVFP4-kvantisering, der modellen opererer ved 5,03 bits per element og blander FP4-eksperter med FP8-lag og BF16 oppmerksomhetslag.

Det er verdt å merke at disse sammenligningstallene kommer fra NVIDIA selv, og at produksjonsforhold kan variere. Men retningen er tydelig nok til å ta på alvor.

Hva er LatentMoE og Multi-Token Prediction?

To tekniske detaljer som faktisk har praktisk betydning:

LatentMoE er NVIDIAs løsning for å rute tokens til eksperter mer effektivt. I stedet for å aktivere mange eksperter med høy kostnad, aktiverer den flere eksperter til fast inferenskostnad. Tenk på det som et smartere trafikkryss – du holder kapasiteten oppe uten at køene vokser.

Multi-Token Prediction (MTP) betyr at modellen forutsier flere fremtidige tokens i ett pass, noe som muliggjør innebygd spekulativ dekoding uten ekstra overhead. Det er en teknikk som også GLM-5 fra Tsinghua bruker – det begynner å bli et fast trekk i de nyeste store åpne modellene.

AI-agent prosesserer et massivt dokument med 1 million tokens kontekstvindu - lysstrøm i digitalt rom
1 million tokens tilsvarer rundt 750 000 ord – nok til å laste inn hele kodebasen til et middels stort prosjekt

Hva er treningsprosessen bak modellen?

NVIDIA har trent Nemotron Ultra på 20 billioner tokens. Deretter har de utvidet kontekstvinduet til 1 million tokens gjennom en egen utvidelsesprosess. For finjustering bruker de noe de kaller MOPD – Multi-teacher On-Policy Distillation – der 10 eller flere spesialiserte lærermodeller destilleres inn i én studentmodell. Tanken er at du samler det beste fra mange nisjemodeller i én generalistmodell.

Modellen slippes under OpenMDW-1.1-lisensen, som betyr åpne vekter, treningsdata og oppskrifter. Det er ikke bare en modell du kan laste ned – det er et sett med ingredienser du kan bruke til å bygge videre.

NVIDIA har gjort lignende grep tidligere med AI-Q forskningsagenten, der de kombinerte åpenhet med sterk ytelse. Nemotron Ultra følger det samme mønsteret – åpen kildekode som et strategisk trekk, ikke bare en PR-øvelse.

Hvem er dette egentlig nyttig for?

Nemotron Ultra er designet for det NVIDIA kaller «long-running agents» – agenter som planlegger, kaller verktøy og resonnerer over mange runder. I praksis betyr det utviklere og bedrifter som bygger komplekse AI-pipelines der kontekstlengde og hastighet faktisk koster noe.

Er du en privatperson som vil prøve det ut? Modellen krever sannsynligvis kraftig hardware for å kjøre lokalt – 550 milliarder totale parametere er ikke noe du dytter inn på et desktop-system. Men kvantisert til NVFP4 (5,03 bits per element) er minneavtrykket langt lavere enn rå FP16 ville tilsi, og NVIDIA tilbyr modellen via API-er for de som vil teste uten å eie maskinvaren selv.

For norske bedrifter som allerede bruker store modeller i produksjon – særlig de som driver med lang dokumentbehandling, juridisk analyse eller kodegjennomgang – er dette et åpent alternativ verdt å følge med på. Du betaler ikke lisens, og du kan finjustere på egne data.

Om det faktisk holder hva NVIDIA lover i praktisk bruk – det er et helt annet spørsmål. Tall fra en produsent er tall fra en produsent. Men arkitekturen er veldokumentert og prinsippene er godt kjente, så det er ikke luftige påstander uten fundament.

Hva tenker du – er 1 million tokens kontekst noe du faktisk ville brukt, eller er det mer enn du noen gang vil trenge?

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre styrer et digitalt kontrollpanel omgitt av Claude AI-symboler og glødende lysstriper i et mørkt rom

Claude AI – pris, funksjoner og norsk guide (2026)

Alt om Claude AI i 2026 – priser i norske kroner, Claude Pro vs Max, Claude Code, og ærlig sammenligning med ChatGPT. Komplett norsk guide fra en som bruker Claude daglig.
Jan Sverre med headphones og lydmikser i boardroom-møte med forvirrede executives

Suno AI Copyright 2026 – Opphavsrett og Rettigheter for AI-Musikk

Kan du tjene penger på Suno-musikk? Her er en praktisk gjennomgang av rettigheter, risiko og hva du bør avklare før publisering.
Jan Sverre blar gjennom en tilpasset YouTube AI-videofeed på telefonen

YouTube lar deg lage din egen AI-videofeed – slik fungerer det

YouTube lar deg nå beskrive hva du vil se med vanlig tekst, og AI setter opp en personlig feed for deg. Her er hva du trenger å vite – og hva det egentlig betyr for deg som bruker.
Jan Sverre tester GPT-5.2 ved en transparent OpenAI GPT-skjerm

GPT-5.2: Jeg testet OpenAIs nyeste modell – her er hva som faktisk fungerer

GPT-5.2 er ute med tre versjoner. Jeg har testet thinking-modellen, sammenlignet med 5.1, og funnet ut hva som faktisk er bedre. Her er mine erfaringer.