Hvis du lager AI-video, kjenner du sikkert problemet: Én modell lager bevegelsen, en annen håndterer referansebildet, en tredje lager lyd, og til slutt håper du at delene fortsatt forestiller samme scene. MiniMax H3 forsøker å samle hele jobben i én modell.

H3 kan lese tekst, bilder, video og lyd som én samlet kontekst, og deretter lage et videoklipp med innebygd stereolyd. Klippene kan være fra 4 til 15 sekunder lange og leveres i opptil 2K. Det interessante er derfor ikke bare enda et oppløsningstall. Modellen kan hente en person fra et bilde, kamerabevegelsen fra en video, stemmen fra et lydklipp og instruksjonene fra en tekstprompt.

MiniMax slapp modellen 31. juli 2026 og publiserte vektene 3. august. Det siste gjør H3 langt mer spennende enn en vanlig API-lansering. Men åpne vekter betyr ikke fritt fram: Den lokale basemodellen lager 768p, MiniMax sin dokumenterte fullflyt for 2K bruker selskapets API til deler av behandlingen, og lisensen har territoriebegrensninger som også kan ramme publisering av output. Det er reelle begrensninger, men de overskygger ikke hovedsaken.

Hva er MiniMax H3?

MiniMax H3 er en omnimodal modell for video med lyd. Ifølge MiniMax sin lansering 31. juli forstår modellen tekst, bilder, video og lyd i samme kontekst, og kan lage opptil 15 sekunder video i 2K med stereolyd. Den er tilgjengelig som MiniMax-H3 i MiniMax sitt API og i Hailuo AI, mens modellvektene nå kan lastes ned.

«Omnimodal» høres ut som et ord noen fant på fem minutter før en presentasjon. Her beskriver det likevel en konkret forskjell. Mange videoløsninger tilbyr tekst-til-video, bilde-til-video, referansevideo, første og siste bilde og videoredigering som separate modeller eller arbeidsflyter. H3 er trent for å uttrykke forholdet mellom kildene og målvideoen med vanlig språk.

Du kan i prinsippet be modellen bruke kameraarbeidet fra én video, en figur fra et bilde og sangen fra et lydklipp. Poenget er ikke at alle produksjoner bør stappe inn flest mulig filer. Poenget er at modellen kan forstå hvilken rolle hver kilde skal ha uten at du må bytte mellom flere spesialmodeller.

Tekst, bilder, video og stereolyd samles i MiniMax H3 som én kontekst
H3 behandler flere referansetyper som én samlet kontekst før modellen lager video og stereolyd.

Hvorfor betyr én samlet kontekst noe?

Én samlet kontekst gjør det mulig å styre innhold, bevegelse, lyd og redigering i samme instruksjon. MiniMax sitt API støtter inntil 9 referansebilder, 3 videoklipp og 3 lydklipp, med maksimalt 12 filer i én forespørsel. Referansevideo og referanselyd kan samlet være opptil 15 sekunder.

Dette passer godt til ekte produksjonsarbeid. En nettbutikk kan bruke produktbilder og en bevegelsesreferanse til å lage flere varianter av samme reklame. En musikkvideo kan hente stemning og kameraarbeid fra video, mens lydsporet forteller modellen hva som skal skje rytmisk. En spillutvikler kan kombinere figurdesign, miljø og ønsket bevegelse uten å bygge hele scenen på nytt for hver modell.

Jeg liker retningen fordi den flytter oppmerksomheten fra modellmenyer til resultatet du faktisk vil ha. I dag lønner det seg ofte å velge ulike AI-videomodeller etter styrke. H3 lover ikke at den er best på alt, men den prøver å redusere antallet overganger hvor identitet, timing eller hensikt kan forsvinne.

Hva kan du gi modellen?

H3 støtter tekst-til-video, bilde-til-video, første og siste bilde, referansebasert generering og regenerering til 2K. Den offisielle API-dokumentasjonen oppgir 768p og 2K som utdata, heltall fra 4 til 15 sekunder og vanlige bildeformater.

I referansemodus kan bilder definere figur, produkt eller miljø. Video kan levere bevegelse, kameraføring og timing. Lyd kan bidra med tale, musikk eller rytme, men lyd kan ikke sendes alene som referanse i API-et. Minst ett bilde eller én video må følge med.

Prompten kan være opptil 7 000 tegn, og hele forespørselen kan være opptil 64 MB. Hvert videoklipp kan være maksimalt 50 MB, hvert bilde 30 MB og hver lydfil 15 MB. Dette er romslig nok til avanserte referanser, men ikke et frikort til å laste opp råmateriale uten å velge. Tolv tydelige kilder slår fort tolv tilfeldige.

Stereolyden er en del av modellen

H3 lager stereolyd sammen med bildet. Lyden er altså ikke et separat spor som en annen modell forsøker å lime på etterpå. Modellkortet beskriver en egen AudioVAE som behandler venstre og høyre kanal hver for seg og setter dem sammen igjen i utdataene.

Det kan være viktigere enn det først høres ut. En bil som passerer gjennom bildet bør også flytte seg i lydbildet. En stemme må treffe riktig person og riktig tidspunkt. Når lyd og video genereres i samme prosess, har modellen i det minste muligheten til å lære disse sammenhengene direkte.

«Native» betyr likevel ikke automatisk perfekt lipsync, stabil stemmeidentitet eller ferdig miks. Det er ting som må vurderes i faktiske tester, ikke bare i en lanseringsvideo. Jeg ville heller ikke erstattet en ferdig masterlyd uten å kontrollere hva modellen gjør med stemmen. Innebygd lyd er et bedre utgangspunkt, ikke en garanti.

Er MiniMax H3 virkelig åpen?

Ja, modellvektene er publisert, men ikke hele 2K-systemet som en fullstendig lokal pakke. MiniMax sitt modellkort på Hugging Face deler systemet i H3-Context-IR, H3-Base og H3-Regenerate-2K. De lokale H3-Base-sjekkpunktene lager video og lyd i 768p.

Den dokumenterte komplette 2K-flyten bruker lokalt generert 768p-video sammen med MiniMax-plattformen. H3-Context-IR tolker og strukturerer referansene, mens regenereringsfasen leser både grunnvideoen og den opprinnelige konteksten for å lage 2K. Det er mer enn en vanlig oppskalering, men det betyr også at «last ned vektene og kjør hele 2K-løpet frakoblet» ikke er det MiniMax dokumenterer nå.

Vektene ligger dessuten under MiniMax H3 Community License Agreement, ikke en standard Apache- eller MIT-lisens. Avtalen unntar EU, Storbritannia, Sør-Korea og USA fra området den gjelder for. Norge står ikke på den listen, men avtalen har flere bruksbegrensninger. Det er derfor riktigere å skrive åpne vekter enn å kalle H3 åpen kildekode. Lisensen må leses før modellen tas i bruk.

Lokal H3 lager 768p før konteksten regenererer videoen til 2K
Den dokumenterte fullflyten starter med lokal 768p, mens 2K-regenereringen fortsatt bruker MiniMax-plattformen.

Lisensen er den største haken

Norge er ikke medlem av EU og er heller ikke uttrykkelig nevnt blant de ekskluderte områdene i MiniMax H3 Community License Agreement. Etter ordlyden ser lokal testing i Norge derfor ut til å være tillatt. EU, Storbritannia, USA og Sør-Korea er derimot uttrykkelig ekskludert.

Her er den største haken: Lisensens punkt V.4 forbyr bruk, reproduksjon, endring, distribusjon eller visning av modellen og «any of their Outputs or results» utenfor det tillatte territoriet. En video som publiseres på en vanlig nettside, YouTube, Instagram eller Facebook blir normalt synlig også i de ekskluderte områdene. Det kan gjøre global publisering av output fra de åpne vektene problematisk, selv om selve genereringen skjer i Norge.

Dette er ikke juridisk rådgivning, og jeg slår ikke fast hvordan avtalen til slutt vil bli tolket. Men ordlyden er bred nok til at en norsk produsent ikke bør anta at alt er uproblematisk bare fordi maskinen står i Norge. Bruk som skal publiseres globalt, bør avklares med MiniMax før man baserer produksjonen på de åpne vektene.

MiniMax sier selv i sin Q&A at API-et er globalt tilgjengelig fordi selskapet driver infrastrukturen og kan håndheve tiltak mot misbruk, copyright-brudd, utrygt innhold og andre compliance-krav. For global publisering er API-et derfor den praktisk tryggere H3-ruten etter MiniMax sin egen forklaring, men det er ikke en juridisk garanti.

Kan du kjøre H3 lokalt?

Ja, H3-Base kan kjøres lokalt, men MiniMax sin egen SGLang-oppskrift bruker 4 GPU-er. Det forteller mer om utgangspunktet enn en løs påstand om at modellen er «klar for lokal bruk». Modellen er tilgjengelig, men det betyr ikke at den er lett å kjøre på en vanlig PC uten tilpasninger.

Samtidig kom støtten raskt. ComfyUI har allerede arbeidsflyter for H3, og MiniMax peker også på SGLang, vLLM og Diffusers. Det gir miljøet rundt modellen en sjanse til å lage kvantiseringer, minneavlasting og bedre kjøreoppsett. Det var nettopp dette lukkede videomodeller lenge gjorde vanskelig.

Jeg ville derfor skilt mellom «mulig lokalt» og «praktisk lokalt». Førstnevnte er bekreftet. Sistnevnte avhenger av maskinvare, klipplengde, oppløsning og hvor mye fart du tåler å ofre. Min egen test av LTX Video 2.3 lokalt er en god påminnelse om at genereringstid og faktisk arbeidsflyt betyr mer enn at vektene finnes på en nedlastingsside.

Hvordan lages 2K uten vanlig oppskalering?

H3 lager først en 768p-versjon og regenererer deretter videoen i 2K med den opprinnelige konteksten tilgjengelig. MiniMax kaller dette In-Context Regeneration. Tanken er at modellen ikke bare skal gjette seg til ekstra piksler, men lese referansebilder, video, lyd og instruksjon på nytt.

Det er en fornuftig idé. En tradisjonell oppskalerer ser hovedsakelig på den ferdige lavoppløste videoen. Hvis en liten detalj allerede er blitt borte, må den rekonstrueres ut fra det som er igjen. H3 får derimot gå tilbake til kildene som beskrev detaljen.

MiniMax oppgir også at H3-VAE gir fire ganger så lang effektiv sekvens, mens en ny treningsarkitektur skal ha løftet gjennomstrømmingen med nær 30 prosent. Dette er leverandørens egne tall, ikke uavhengige målinger. De forklarer likevel hva selskapet har forsøkt å løse: 2K-video med lyd og mange referanser blir fort en voldsom mengde data.

Hva koster MiniMax H3?

MiniMax sin offisielle pristabell oppgir nå 0,13 dollar per sekund for 2K og 0,08 dollar per sekund for 768p. Med Norges Banks siste tilgjengelige dollarkurs før publisering tilsvarer det omtrent 1,24 kroner og 76 øre per sekund.

Et 15-sekunders klipp koster dermed 1,95 dollar, cirka 19 kroner, i 2K. Det samme klippet i 768p koster 1,20 dollar, cirka 11 kroner. Referanselyd er gratis, og de fem første referansebildene er inkludert. Deretter koster hvert ekstra bilde 0,04 dollar, omtrent 38 øre. Referansevideo prises per sekund etter valgt utdataoppløsning.

Regenerering fra 768p til 2K koster ytterligere 0,05 dollar per sekund, omtrent 48 øre, og inngangsmaterialet faktureres på nytt. Åpne vekter gir fortsatt muligheten til å betale med egen maskinvare og tid i stedet for API-kreditter. Men siden den dokumenterte fullflyten for 2K bruker MiniMax-tjenester, er ikke hele regnestykket lokalt ennå. Den interessante prisen er uansett ikke bare ett klipp, men alle forsøkene du forkaster før du får det du trenger.

Hvem er H3 mest interessant for?

H3 er mest interessant for dem som allerede arbeider med flere typer referanser: reklame, produktvideo, spillsekvenser, animasjon og musikkvideo. Hvis du bare trenger et tilfeldig femsekundersklipp fra tekst, finnes det enklere veier. Hvis du må holde sammen bevegelse, motiv, lyd og redigeringsinstruksjoner, treffer H3 et reelt problem.

Det betyr ikke at modellen automatisk slår alle konkurrentene. Kvaliteten må vurderes per oppgave, og MiniMax sine egne demonstrasjoner er valgt for å vise modellen fra sin beste side. Jeg er særlig nysgjerrig på hvor stabil stemmen er, hvor godt lydreferanser faktisk styrer resultatet, og hvor mye den åpne 768p-modellen beholder av API-versjonens kvaliteter.

Likevel er retningen tydelig. MiniMax har tidligere vist at selskapet vil konkurrere med åpne modeller, blant annet med den omnimodale MiniMax M3. Med H3 flyttes den samme tanken inn i kreativ produksjon. Den virkelige nyheten er ikke at et klipp kan være 15 sekunder. Det er at flere deler av produksjonen kan forstås som én sammenhengende oppgave.

Ofte stilte spørsmål

Kan MiniMax H3 lage video med lyd?

Ja. H3 genererer video og stereolyd i samme modell. MiniMax beskriver støtte for tekst, bilder, video og lyd som inngang, mens resultatet kan være et klipp på 4 til 15 sekunder med innebygd stereolyd.

Kan jeg bruke MiniMax H3 lokalt i Norge og publisere resultatet globalt?

Lokal testing i Norge ser tillatt ut etter lisensens ordlyd fordi Norge ikke er uttrykkelig ekskludert. Global publisering av output fra åpne vekter kan likevel være problematisk når innholdet blir synlig i EU, Storbritannia, USA eller Sør-Korea. Bruken bør avklares med MiniMax. Dette er ikke juridisk rådgivning.

Fungerer hele 2K-flyten uten MiniMax sitt API?

Ikke i den dokumenterte løsningen per 3. august 2026. Lokal H3-Base lager 768p, mens MiniMax sin fullflyt for 2K kombinerer den lokale basen med plattformtjenester for konteksttolking og regenerering.

Hvilke referanser kan H3 bruke?

H3 kan bruke tekst, inntil 9 bilder, inntil 3 videoklipp og inntil 3 lydklipp i én referanseforespørsel. Det kan være maksimalt 12 filer totalt, og lydreferanser må ledsages av minst ett bilde eller én video.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Jan Sverre inne i en lysende kunstig hjerne bygget av datakretser - illustrasjon av AGI og kunstig generell intelligens

Hva Er AGI? Kunstig Generell Intelligens Forklart på Norsk (2026)

Hva er AGI? Kunstig generell intelligens forklart enkelt på norsk. Hvor langt har vi kommet i 2026, når tror ekspertene AGI kommer, og hva betyr det for deg?