Innhold Vis
MiniMax H3 lokalt på én RTX 4090 føles som et lite produksjonsverktøy, ikke bare en modell som animerer ett bilde. Etter 18 testvideoer satt jeg igjen med brukbar identitet, videoreferanser, lyd, scenetransformasjoner og tegnefilm – ofte i samme arbeidsflyt.
Det betyr ikke at én prompt gir en ferdig film. H3 belønner regi, testing og klipping: én tydelig fysisk oppgave per klipp, riktig sampler og en vilje til å kombinere det beste fra flere genereringer. Når det virker, er det fryktelig morsomt. Når det ikke virker, får du gjerne et håndgrep som blir til suppe eller en replikk fra en alternativ virkelighet.
Jeg testet modellen fra 4. til 8. august 2026 med 24 GB VRAM. Den praktiske vinneren ble 12-13 sekunders vertikal video, Turbo 8, SageAttention og oppskalering med RTX HIGH. Her er hele oppsettet, målingene og feilene som faktisk er verdt å kjenne til.
Hva fikk jeg faktisk til med MiniMax H3?
Jeg fikk MiniMax H3 til å kombinere identitetsbilder, referansevideo, tilhørende lyd, separate lydfiler og første/siste bilde i reelle klipp. Modellen kan også generere native stereolyd. Det offisielle modellkortet beskriver H3 som en omnimodal modell, men det viktige for meg var at inngangene faktisk lot seg bruke sammen lokalt.
Det første tegnefilmklippet holdt figur, klær, cel-stil og kontorstol samlet gjennom omtrent ti sekunder. Vaskeriet viste deretter identitet, video og lyd i en lengre referansetest med SageAttention og RTX-oppskalering. Basekjøringen tok 867,54 sekunder, så kvaliteten var der før farten var det.
Krimløperen var en vanskeligere stresstest med løping, bakoverblikk, bil, trafikkjegle og vannsprut. Identiteten og anatomien holdt overraskende godt mens motivet beveget seg gjennom scenen. For musikkvideo og fortellende klipp er akkurat det mer nyttig enn enda en person som står stille og svaier foran kameraet.
Tegnefilm og kontorstol
Vaskeri, Sage og RTX
Nordic Crime Runner
Slik kjørte jeg MiniMax H3 lokalt på én RTX 4090
Den stabile profilen på min maskin var 736 × 1312, 24 fps og normalt 294-311 frames. Det tilsvarer omtrent 12,25-12,96 sekunder. Jeg brukte Turbo-LoRA med strength 1.0, MiniMaxH3TurboSampler, simple scheduler og 8 steg, før dekodede frames ble skalert til 1080 × 1920 med RTX Video Super Resolution på HIGH.
Maskinen hadde RTX 4090 med 24 GB VRAM og 64 GB systemminne. Miljøet var ComfyUI v0.30.1, Python 3.12.10, PyTorch 2.10.0+cu130, SageAttention 2.2.0+cu130torch2.10.0andhigher.post5 og Triton Windows 3.6.0.post26. H3 Turbo-noden var v1.1.0, commit 96cc1ddc001617da132dd73f31cd43666bf1d8d4.
Det testede modellsettet tok omtrent 59,15 GiB, eller 59,87 GiB med Turbo-LoRA. De viktigste filene var minimax_h3_ref2va_pruned_int8_convrot.safetensors og minimax_h3_fl2va_pruned_int8_convrot.safetensors i ComfyUI/models/diffusion_models, qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors i ComfyUI/models/text_encoders, video- og audio-VAE-filene i ComfyUI/models/vae, samt Turbo-LoRA-en i ComfyUI/models/loras/MiniMaxH3. Store nedlastinger bør kunne gjenopptas og kontrolleres før en midlertidig .part-fil får endelig navn.
Turbo må bruke den dedikerte H3 Turbo-sampleren. Video og lyd følger forskjellige flytplaner, og en vanlig sampler med svært få steg kan overdrive lydstrømmen til den blir forvrengt. Turbo-noden og bruken av MiniMaxH3TurboSampler er dokumentert i prosjektets GitHub-repositorium.
Video, lyd og identitet i samme klipp
Sildajazz-testen kombinerte ett identitetsbilde, en hel videoreferanse og lyden som hørte til videoen. H3 hentet festivalmiljøet og kamerafølelsen, plasserte meg blant folk og avsluttet med en ryddig vink. Dette er generativ referansebruk, ikke pikselnøyaktig compositing, men nettopp derfor viser klippet hvor mye modellen kan hente fra flere innganger samtidig.
En ny variant brukte det samme referansemiljøet til en forsinket og langt mer absurd avsløring. Her var poenget ikke personen som dukker opp, men at modellen ventet med avsløringen og lot miljøet bære scenen først. Det er en liten ting som betyr mye når et klipp faktisk skal fortelle noe.
Sildajazz med identitetsreferanse
Forsinket Trump-avsløring
I den norske Audio 0-testen brukte jeg et identitetsbilde og et 12-sekunders utdrag fra min egen WAV-fil. Den genererte lyden hadde waveform-korrelasjon på 0,952816 og energi-envelope-korrelasjon på 0,988222 ved null tidsforskyvning. Det viser svært tett timing, men ikke perfekt fonem-lipsync. Munnbevegelsen lukket seg ikke i alle målte pauser, så den ferdige demonstrasjonen fikk den eksakte WAV-filen muxet tilbake.
Nyra-klippet brukte første og siste bilde over 8,7 sekunder. Figuren gikk gjennom en lysportal og endte som menneske, med god overordnet kontinuitet. En liten klesdetalj drev og ekstra tale måtte trimmes, men selve forvandlingen holdt. At klippet endte på Nyra sin egen kanal passer egentlig ganske godt.
Norsk Audio 0-test
Nyra first/last-frame
Base 20 mot Turbo 8 og Turbo 6
Reality Debugger i Haugesund var den reneste A/B-testen. Prompt, seed, to max-referanser, native oppløsning, antall frames og RTX HIGH var like. Scenen krevde at jeg gikk i en regnvåt gate, grep en cyan søm i virkeligheten, dro gaten til side og gikk inn i en varm alternativ verden.
| Profil | Veggtid | Praktisk dom |
|---|---|---|
| Base 20 | 24:15,53 – 1455,53 sekunder | Renest og roligere tekstur, men for treg til mye iterasjon |
| Turbo 8 | 10:45,28 – 645,28 sekunder | Beste balanse og min standardprofil |
| Turbo 6 | 8:30,28 – 510,28 sekunder | Rask preview, men synlig grid- og effektlekkasje |
Base 20 holdt håndgrepet, folden, overgangen og sluttansiktet, men brukte 24 minutter og 15,53 sekunder. Turbo 8 gjorde samme jobb på 10 minutter og 45,28 sekunder. Det er 2,256 ganger raskere og 55,7 prosent kortere veggtid. Hudteksturen ble mer aggressiv og sluttsmilet mer intenst, men tidsgevinsten var stor nok til at jeg faktisk kunne prøve flere ideer.
Turbo 6 kom ned i 8 minutter og 30,28 sekunder, 135 sekunder raskere enn Turbo 8. Prisen var tydelig: folden fikk mer laser- og hologrampreg, mens gridstriper lekket over gate, jakke og deler av ansiktet. Jeg ville brukt den til preview, ikke som fast profil for ferdige klipp.
Base 20
Turbo 8 – beste balanse
Turbo 6 – rask preview
H3 er best når én visuell idé får plass
Running in ComfyUI lot en regnvåt gate gradvis bli til en fysisk nodeverden mens jeg gikk over i løp. Identiteten holdt og transformasjonen skjedde gradvis uten svart eller grå slutt. Små pseudo-elementer på nodeflatene avslører fortsatt modellen, men en abstrakt idé ble faktisk fysisk og filmbar.
Latent Trench, The Source Code og Caffeine Overclock prøver tre forskjellige grep: et fysisk miljø som åpner seg, en digital verden som tar over og en effektstyrt overgang. Fellesnevneren er én tydelig visuell idé med en person som beveger seg gjennom den. H3 trives bedre med det enn med en ønskeliste på fem kritiske hendelser.
Latent Trench
The Source Code
Caffeine Overclock
Anime-paret ga en enkel regel jeg kommer til å ta med videre. Anime Ink Dragon startet fra et halvrealistisk bilde og endte nærmere vestlig tegneserie og concept art, selv om prompten ba om anime. True Anime Train startet med et genuint anime-bilde og traff stilen mye bedre. Startbildet snakker høyere enn stilordene i prompten.
Anime Ink Dragon
True Anime Train
Haugesund-timelapsen ble bedre da prompten beskrev fysiske handlinger og klesskift konkret. Gange, mennesker og klær endret seg, mens regnet jeg ba om fortsatt uteble. Når scenen allerede har mange oppgaver, må en kritisk detalj gjøres fysisk sentral eller flyttes til et eget klipp.
Fysisk kontakt må ofte løses i klippen
Tegnefilmsekvensen med Inger Marie og meg viste den reelle produksjonsmetoden tydeligst. Turbo ga energi og jakt, men grappling og håndjern ble smurt sammen. Base 20 gjorde en enklere sweep og pin langt tydeligere. Den beste videoen ble derfor et hybridklipp fra begge.
Det er ikke et nederlag. Én profil var best på tempo, en annen på kontaktøyeblikket. Når hender, grep eller grappling flyter sammen, bør koreografien forenkles til ett tydelig kontaktpunkt. Base 20 kan brukes akkurat der presisjonen trengs, mens Turbo kan bære resten av bevegelsen.
Det samme gjelder lyd. H3 lager native stereo ved 32 kHz, og lydlandskapet gjør utkast langt mer komplette. Men begge Reality Debugger-variantene uttalte den engelske replikken feil, omtrent «Reality is just the deafualt sesting», og enkelte klipp la til ord. Når teksten må være eksakt, lytter jeg gjennom og muxer masterlyden tilbake.
Hvor lange og skarpe klipp er realistiske?
Omtrent 12-13 sekunder var den stabile, praktiske sonen for vertikal produksjon. Rundt 15 sekunder kan fungere, men halen kan kollapse til grå tekstur når handlingen er ferdig. Da er løsningen å trimme ved siste rene frame, ikke å kaste hele klippet. Et 20-sekundersforsøk var ikke en trygg arbeidsprofil, og en wrapper traff også en tensor-konflikt mellom modaliteter.
Native 1088 × 1920 fungerte for 124 frames, eller 5,17 sekunder, men tok 11 minutter og 45,32 sekunder med Turbo 8. Et 311-frame-forsøk i samme oppløsning reset NVIDIA-driveren med SageAttention. Uten Sage lå jobben stabilt rundt 23,6 GiB VRAM, men var bare 13 prosent ferdig etter 1 time, 25 minutter og 37,9 sekunder. Jeg avbrøt.
Derfor er ikke full lokal 2K den nyttige historien på denne maskinen. 736 × 1312 og RTX HIGH til 1080 × 1920 gir et langt bedre forhold mellom tid og resultat. I en kontrollert test ga HIGH omtrent 81 prosent mer kantenergi enn Lanczos, med 8,6 prosent mer variasjon mellom naboframes. ULTRA ga bare rundt 2 prosent mer kantenergi enn HIGH, men 7,6 prosent mer temporal variasjon.
Feilene og løsningene som sparer mest tid
Den første smoke-jobben feilet fordi PathchSageAttentionKJ sto på auto, men likevel prøvde å importere SageAttention som ikke var installert. Jeg satte noden i bypass i workflowkopien og kjørte kontrolltesten med vanlig Comfy-attention. Etterpå installerte jeg wheels som matchet Python-, Torch- og CUDA-matrisen, og kjørte pip check. Ikke kjør ukritisk pip install --upgrade -r requirements.txt; det kan bytte ut riktig CUDA-Torch med en inkompatibel eller CPU-basert pakke.
En varm korttest med Sage tok 48,223 sekunder mot 70,15 sekunder med vanlig attention – 31,3 prosent kortere tid og 1,455 ganger throughput. Den første kalde Sage-kjøringen tok derimot 123,08 sekunder på grunn av oppvarming og kompilering. Ett kaldt tall er et dårlig benchmark.
RTX-noden hadde en annen konkret felle. Et nestet resize_type-objekt feilet i valideringen før jobben startet. Dimensjonene må sendes som flate felt:
{
"resize_type": "target dimensions",
"resize_type.width": 1080,
"resize_type.height": 1920,
"quality": "HIGH"
}
De øvrige løsningene følger samme mønster: bruk MiniMaxH3TurboSampler når Turbo kjøres med få steg, trim en grå hale ved siste rene frame, bruk rene identitetsbilder når max-referanser drar bakgrunnen med seg, og reduser antall samtidige oppgaver når en kritisk detalj forsvinner. Det høres nesten for enkelt ut. Det er ofte det som virker.
Hvem er MiniMax H3 nyttig for?
H3 er mest interessant for deg som lager musikkvideoer, filmatiske småscener, morsomme klipp eller annet der identitet, bevegelse, miljø og lyd må møtes. En lokal modell trenger ikke slå alle skytjenester på hvert enkelt bilde for å være verdifull. Muligheten til å teste videre uten pris per forsøk og gå inn i hele grafen er en egen produktivitetsgevinst.
Har du bare behov for ett raskt klipp uten oppsett, er en skytjeneste enklere. Her må du laste ned rundt 60 GiB med modeller, holde Python-, Torch- og CUDA-versjoner på linje og akseptere omtrent ti minutter for et godt Turbo 8-forsøk. Til gjengjeld får du en arbeidsflyt der video, bilder og lyd kan styre samme generering.
MiniMax H3 har åpne vekter, men bruker en egen community-lisens og er ikke standard FOSS. Norge står ikke blant de ekskluderte territoriene, men avtaleteksten bør leses før lokal eller kommersiell bruk. Jeg har gått nærmere inn på både modellen og lisenshaken i bakgrunnssaken om MiniMax H3.
Min dom etter 18 videoer er at Turbo 8 flytter H3 fra imponerende demonstrasjon til noe det går an å iterere med. Ti minutter er fortsatt ti minutter, men det er kort nok til flere ideer på en kveld. Sammenlignet med min lokale test av LTX 2.3 er H3 særlig spennende fordi flere referansetyper og native lyd møtes i samme system.
Det beste sluttproduktet kan være Turbo-bevegelse, et Base 20-kontaktøyeblikk og ekstern masterlyd klippet sammen. «Én generering» er en ganske dårlig målestokk for ekte produksjonsnytte. Dette er AI-videoen som fikk meg til å fortsette å prøve.
Workflowen jeg startet med
Jeg lager vanligvis mine egne ComfyUI-workflows, men denne gangen tok jeg utgangspunkt i Nerdy Rodent sin ryddige samleworkflow og bevarte originalen før jeg jobbet videre i en kopi. Den samler tekst-til-video, startbilde, første/siste bilde, flere bilde-, video- og lydreferanser, modellbytte og eksport i én graf.
Gjennomgangen varer 15:35 og er et godt startpunkt hvis du vil forstå selve grafen. Mine tester gikk videre med SageAttention, RTX HIGH, Turbo 8 og 6, norsk Audio 0, A/B-målinger og ferdig klipping.
Workflow og gjennomgang: Nerdy Rodent
Ofte stilte spørsmål
Kan MiniMax H3 kjøres lokalt på 24 GB VRAM?
Ja. I min test kjørte en RTX 4090 med 24 GB VRAM omtrent 12-13 sekunders vertikal video ved 736 × 1312, før RTX HIGH skalerte til 1080 × 1920. Det er en dokumentert profil for denne maskinen, ikke et løfte om samme fart på alle 24 GB-kort.
Er Turbo 8 bedre enn Base 20 i MiniMax H3?
Turbo 8 var den beste praktiske balansen, ikke den absolutte kvalitetsvinneren. Den tok 10:45,28 mot 24:15,53 for Base 20 og beholdt hovedhandlingen. Base ga roligere tekstur og kunne være bedre på vanskelig fysisk kontakt.
Kan MiniMax H3 lage norsk tale og lipsync?
H3 kan følge en norsk lydreferanse tett og generere talelignende munnbevegelse, men testen beviser ikke perfekt fonem-lipsync. Når ordene må være eksakte, bør du kontrollere lyden og muxe den originale WAV-filen tilbake i det ferdige klippet.
Hvor mye lagringsplass trenger MiniMax H3 lokalt?
Modellsettet i testen tok omtrent 59,15 GiB og 59,87 GiB med Turbo-LoRA. I tillegg kommer ComfyUI, Python, Torch, noder og genererte videoer. Ha derfor god diskplass og bruk nedlastinger som kan gjenopptas for de største modellfilene.