Innhold Vis
Vil du kjøre en AI-agent som kan lese og resonnere over en million tokens uten å krasje eller bli treig? NVIDIA mener de har svaret – og de gir vekter, treningsdata og oppskrifter helt åpent. Det er ikke en liten ting i en bransje der de store spillerne helst beholder magien for seg selv.
Nemotron Ultra er ikke nok en modell du bare leser om og glemmer. Det er en 550 milliarder parameter Mixture-of-Experts-modell med en hybrid arkitektur som kombinerer Mamba-lag og oppmerksomhetslag på en måte som faktisk gir deg noe praktisk: høyere hastighet og lengre kontekst samtidig. De fleste store modeller velger det ene eller det andre. Her er begge deler.
La oss se på hva som faktisk skiller dette fra mengden – og hva det betyr i praksis.
Hva er Nemotron Ultra, og hva gjør den annerledes?
Nemotron Ultra er en åpen Mixture-of-Experts-modell med totalt 550 milliarder parametere, men bare 55 milliarder aktive per token. Det betyr at den ikke bruker hele sin kapasitet på hvert enkelt trinn – den ruter token til de 22 mest relevante ekspertene av totalt 512 i hvert lag. Resultatet er at du får ytelsen til en veldig stor modell til en brøkdel av regnekostnaden.
Det som virkelig skiller Nemotron Ultra fra andre store åpne modeller er arkitekturen. Den kombinerer Mamba-lag – som skalerer sub-kvadratisk med kontekstlengde – med et fåtall vanlige oppmerksomhetslag for presise gjenkallelser. Praktisk konsekvens: du kan ha en million tokens kontekst uten at inferenstiden eksploderer slik den ville gjort med en ren transformer-arkitektur.

Hva er 1 million tokens i praksis?
1 million tokens tilsvarer omtrent 750 000 ord – eller rundt ti romaner. Det er nok til å laste inn hele kodebasen til et middels stort prosjekt, alle møtereferater fra et år, eller et langt juridisk dokument og stille spørsmål om detaljene.
For AI-agenter som kjører over mange runder – planlegger, kaller verktøy, resonnerer – er dette særlig nyttig. Agenten kan holde styr på hele konteksten uten å måtte oppsummere og kaste informasjon underveis. NVIDIA oppnår dette gjennom det de kaller RULER @ 1M tokens-test, der Nemotron Ultra scorer 94,7 av 100. Det er et mål på hvor godt modellen faktisk husker og bruker informasjon fra hele kontekstvinduet.
Vil du lese mer om hva NVIDIA har bygd rundt agenter den siste tiden? Jeg skrev om NemoClaw og NVIDIAs agentplattform tidligere – Nemotron Ultra er den rå modellmotoren som kan ligge under slike systemer.
Hvor mye raskere er den enn konkurrentene?
NVIDIA oppgir at Nemotron Ultra leverer opptil 6x høyere inferens-throughput enn sammenlignbare åpne modeller ved tilsvarende nøyaktighet. På en konkret test med 8 000 tokens inn og 64 000 tokens ut er tallene:
- 5,9x raskere enn GLM-5.1
- 4,8x raskere enn Kimi-K2.6
- 1,6x raskere enn Qwen-3.5
Hva betyr det i praksis? At du kan kjøre langt mer inferens per GPU-time – noe som monner på regningen om du er en bedrift som faktisk bruker modellen i produksjon. De oppnår dette delvis gjennom NVFP4-kvantisering, der modellen opererer ved 5,03 bits per element og blander FP4-eksperter med FP8-lag og BF16 oppmerksomhetslag.
Det er verdt å merke at disse sammenligningstallene kommer fra NVIDIA selv, og at produksjonsforhold kan variere. Men retningen er tydelig nok til å ta på alvor.
Hva er LatentMoE og Multi-Token Prediction?
To tekniske detaljer som faktisk har praktisk betydning:
LatentMoE er NVIDIAs løsning for å rute tokens til eksperter mer effektivt. I stedet for å aktivere mange eksperter med høy kostnad, aktiverer den flere eksperter til fast inferenskostnad. Tenk på det som et smartere trafikkryss – du holder kapasiteten oppe uten at køene vokser.
Multi-Token Prediction (MTP) betyr at modellen forutsier flere fremtidige tokens i ett pass, noe som muliggjør innebygd spekulativ dekoding uten ekstra overhead. Det er en teknikk som også GLM-5 fra Tsinghua bruker – det begynner å bli et fast trekk i de nyeste store åpne modellene.

Hva er treningsprosessen bak modellen?
NVIDIA har trent Nemotron Ultra på 20 billioner tokens. Deretter har de utvidet kontekstvinduet til 1 million tokens gjennom en egen utvidelsesprosess. For finjustering bruker de noe de kaller MOPD – Multi-teacher On-Policy Distillation – der 10 eller flere spesialiserte lærermodeller destilleres inn i én studentmodell. Tanken er at du samler det beste fra mange nisjemodeller i én generalistmodell.
Modellen slippes under OpenMDW-1.1-lisensen, som betyr åpne vekter, treningsdata og oppskrifter. Det er ikke bare en modell du kan laste ned – det er et sett med ingredienser du kan bruke til å bygge videre.
NVIDIA har gjort lignende grep tidligere med AI-Q forskningsagenten, der de kombinerte åpenhet med sterk ytelse. Nemotron Ultra følger det samme mønsteret – åpen kildekode som et strategisk trekk, ikke bare en PR-øvelse.
Hvem er dette egentlig nyttig for?
Nemotron Ultra er designet for det NVIDIA kaller «long-running agents» – agenter som planlegger, kaller verktøy og resonnerer over mange runder. I praksis betyr det utviklere og bedrifter som bygger komplekse AI-pipelines der kontekstlengde og hastighet faktisk koster noe.
Er du en privatperson som vil prøve det ut? Modellen krever sannsynligvis kraftig hardware for å kjøre lokalt – 550 milliarder totale parametere er ikke noe du dytter inn på et desktop-system. Men kvantisert til NVFP4 (5,03 bits per element) er minneavtrykket langt lavere enn rå FP16 ville tilsi, og NVIDIA tilbyr modellen via API-er for de som vil teste uten å eie maskinvaren selv.
For norske bedrifter som allerede bruker store modeller i produksjon – særlig de som driver med lang dokumentbehandling, juridisk analyse eller kodegjennomgang – er dette et åpent alternativ verdt å følge med på. Du betaler ikke lisens, og du kan finjustere på egne data.
Om det faktisk holder hva NVIDIA lover i praktisk bruk – det er et helt annet spørsmål. Tall fra en produsent er tall fra en produsent. Men arkitekturen er veldokumentert og prinsippene er godt kjente, så det er ikke luftige påstander uten fundament.
Hva tenker du – er 1 million tokens kontekst noe du faktisk ville brukt, eller er det mer enn du noen gang vil trenge?