Hvis du lager musikk med AI, er MiniMax-Music3 en modell det er verdt å følge med på. Den tar imot sangtekst med seksjonsmarkører og en detaljert beskrivelse av musikken, og lager en komplett sang på opptil fem minutter i én generering. Vekter og inferenskode kan lastes ned, og lydformatet avhenger av kjøreveien: SGLang-referanseserveren gir 32 kHz, 16-bit stereo WAV, mens Diffusers leverer 44,1 kHz stereo direkte.

Det er kombinasjonen som gjør denne lanseringen spennende. Mange åpne lydmodeller har vært best egnet til korte klipp, instrumentaler eller tekniske eksperimenter. MiniMax-Music3 sikter rett på hele sangen: intro, vers, refreng, bro, instrumentalparti og outro, med vokal og arrangement som skal henge sammen hele veien.

Men «åpne vekter» betyr ikke fri bruk uten liten skrift, og «kan kjøres på 8 GB VRAM» betyr ikke at det blir raskt eller behagelig. MiniMax har dokumentert tre ganske forskjellige veier inn: SGLang-Omni på to CUDA-GPU-er, Diffusers på ett skjermkort med ulike former for offloading og en ferdig ComfyUI-flyt. Det er her nyheten går fra imponerende modellkort til noe du faktisk kan vurdere å bruke.

Hva er MiniMax-Music3?

MiniMax-Music3 er en åpen-vekt-modell for tekst-til-musikk som lager komplette sanger på opptil fem minutter. Ifølge MiniMax sitt offisielle modellarkiv styres den av to tekstfelt: selve sangteksten og en separat musikkbeskrivelse. SGLang-serveren returnerer 32 kHz, 16-bit stereo WAV. Diffusers-dokumentasjonen oppgir 44,1 kHz stereo fra den opprinnelige dekoderen og anbefaler egen resampling hvis du trenger 32 kHz.

De to feltene har ulike jobber. Sangteksten inneholder ordene som skal synges, sammen med markører som [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental], [Solo] og [Outro]. Musikkbeskrivelsen styrer blant annet sjanger, tempo, toneart, stemme, instrumentering, følelsesmessig utvikling og produksjonsuttrykk.

MiniMax anbefaler en strukturert beskrivelse med tre deler: Global Metadata, Vocal Details og Arrangement. Det er mer arbeid enn å skrive «lag en fengende poplåt», men også langt mer nyttig. Du skiller ordene fra regien og kan beskrive hvordan arrangementet skal utvikle seg fra seksjon til seksjon.

Hvorfor er fem minutter i én generering viktig?

Fem minutter betyr at modellen har plass til en normal sangstruktur uten at du først må lage en samling korte lydklipp og lime dem sammen. MiniMax oppgir en grense på 9 000 lydrammer, mens modellen arbeider med 25 rammer per sekund. Fem minutter tilsvarer 7 500 rammer og ligger dermed innenfor den dokumenterte rammen.

Den praktiske gevinsten er sammenheng. En modell som lager hele sporet i én omgang får mulighet til å holde fast ved melodiske temaer, rytme, vokalkarakter og instrumentering gjennom sangen. MiniMax hevder at nettopp lang struktur og stabile arrangementer er en hovedstyrke. Det er leverandørens egen vurdering, ikke en uavhengig lyttetest, men arkitekturen er tydelig bygget rundt problemet.

Kontrollmarkørene er heller ikke en noteblokk med absolutte ordre. Modellkortet advarer om at tempo, toneart, instrumenter, tekst og sangstruktur kan avvike fra bestillingen. Du gir modellen en tydelig plan, men du får fortsatt en generativ tolkning. Det skillet er viktig hvis musikken skal passe et bestemt klipp, en fast varighet eller en allerede skrevet vokallinje.

Hvordan holder modellen styr på en hel sang?

MiniMax-Music3 deler jobben mellom en Global LLM på 8 milliarder parametere og en Local LLM på 0,6 milliarder. Den globale modellen følger den langsiktige musikalske strukturen, mens den lokale fyller inn akustiske detaljer innenfor hver lydramme. Deretter går de sammenslåtte representasjonene gjennom en flow matching-modul på 2,4 milliarder parametere og en Flow-VAE-dekoder på 123 millioner.

Under treningen brukes åtte lag med residual vector quantization, forkortet RVQ. Det første kodeboklaget har 16 384 oppføringer og bærer den sentrale musikalske betydningen og strukturen. De sju neste har 1 024 oppføringer hver og fanger opp resterende akustiske detaljer. Den globale modellen forutsier det første laget fra ramme til ramme, mens den lokale modellen arbeider med de øvrige lagene.

Det spesielle grepet kommer i syntesen. Modellen dekoder ikke bare de diskrete RVQ-symbolene tilbake til lyd. Den slår sammen de siste skjulte tilstandene fra begge språkmodellene og sender denne kontinuerlige informasjonen videre til flow matching og Flow-VAE. MiniMax mener dette bevarer mer informasjon om vokal, instrumentklang og tidsmessig sammenheng. Den diskrete tokenizer-dekoderen lastes faktisk ikke under inferens.

Arkitektur i MiniMax-Music3 fra globale modeller til ferdig stereolyd lokalt
Den globale modellen følger sangstrukturen, mens lokale lag fyller inn akustiske detaljer før ferdig stereolyd.

Global LLM er ifølge modellkortet basert på Qwen3-8B. Det er verdt å merke seg for dem som er skeptiske til kinesiske grunnmodeller, men musikkdelen er ikke bare Qwen med et nytt navn. MiniMax har tilpasset inn- og utlagene til musikalske symboler, lagt til den lokale modellen og bygget en egen syntesekjede rundt dem.

Hvordan kjører du MiniMax-Music3?

Den mest direkte serverveien er SGLang-Omni. Referanseoppsettet bruker to CUDA-GPU-er: GPU 0 kjører språkmodellen og den autoregressive genereringen av åtte RVQ-kodebøker, mens GPU 1 tar flow matching og dekodingen til lydbølge. Serveren startes med modellbanen og eksponerer et felles taleendepunkt der sangteksten legges i input og musikkbeskrivelsen i instructions.

Diffusers er den mer tilgjengelige veien for ett skjermkort. Den offisielle Diffusers-integrasjonen oppgir rundt 23 GB VRAM i bfloat16. Automatisk CPU-offloading bruker rundt 22 GB, og såkalt leaf-level group offloading kan strømme språkmodellagene mellom minne og GPU slik at modellen får plass på 8 GB. Prisen er lavere fart.

Integrasjonen ble slått sammen i Diffusers 13. august, men ligger foreløpig på hovedgrenen mot versjon 0.40.0.dev0. Den siste stabile PyPI-utgaven er fortsatt 0.39.0. Skal du kjøre eksemplet nå, må du derfor installere Diffusers fra hovedgrenen eller vente på neste stabile utgave. Det er en liten versjonsdetalj som ellers fort blir en stor feilmelding.

Den tredje veien er ComfyUI, som har en egen MiniMax Music 3-mal og ompakka FP16- og INT8-modeller. Dette er sannsynligvis den hyggeligste inngangen for mange som allerede bruker lokale bilde-, video- og lydmodeller i nodeflyter. Modellen krever uansett CUDA, og strømming støttes ikke. Du venter på hele genereringen før lydfilen er ferdig.

Tre kjøreveier for MiniMax-Music3 med ulike krav til GPU og VRAM
SGLang-Omni, Diffusers og ComfyUI gir tre ulike veier til lokal generering med MiniMax-Music3.

Hvor stor er modellen i praksis?

Filene i Hugging Face-arkivet utgjør omtrent 57,4 GB. Det er viktig å skille lagringsplass fra VRAM: du trenger plass til å laste ned vektene, men Diffusers kan flytte deler mellom systemminnet og skjermkortet. At den kan presses inn på en GPU med 8 GB betyr derfor ikke at modellen bare er 8 GB stor.

Tekstprompten kan være på opptil 5 000 tokens. Det gir rikelig plass til både lang sangtekst og en grundig beskrivelse, men det betyr ikke at mer tekst alltid gir bedre musikk. Tre tydelige blokker for global stil, vokal og arrangement er lettere å styre enn et langt avsnitt der sjanger, produksjon, instrumenter og seksjonsendringer flyter sammen.

Jeg ville også startet kort før jeg ba om fem minutter. Ikke fordi femminuttersgrensen er pynt, men fordi hver endring i prompt, vokalretning og arrangement blir dyrere i ventetid når du regenererer hele sangen. Få først uttrykket på plass i et kortere spor. Deretter kan du øke varigheten og bygge den komplette strukturen.

Er dette open source?

Nei, ikke i vanlig OSI-forstand. Vektene og koden er tilgjengelige, og kommersiell bruk er tillatt, men de ligger under MiniMax-Music3 Community License. Den offisielle lisensen krever blant annet at kommersielle produkter viser «MiniMax-Music3» tydelig i brukergrensesnittet.

Hvis samlet årlig omsetning fra produkter og tjenester som bruker modellen overstiger 20 millioner dollar, må du ha skriftlig tillatelse fra MiniMax på forhånd. Med en dollarkurs rundt 9,5 kroner er det omtrent 190 millioner kroner. Det er ikke en grense som treffer hobbybrukeren, men den er absolutt relevant før en bedrift bygger modellen inn i et produkt.

Tilbyr du musikkgenerering til andre, må du også ha tekniske og organisatoriske tiltak som forebygger lisensbrudd og krenkende bruk, og disse skal testes og vurderes jevnlig. Lisensen krever dessuten tydelig merking av offentlig AI-generert innhold. Dette er med andre ord en brukbar kommersiell lisens, men ikke en «gjør hva du vil»-lisens.

Hvem passer MiniMax-Music3 for?

Modellen er mest interessant for dem som vil eie mer av selve produksjonsløpet: kreative verktøy, spill, reklame, podkast, videoproduksjon og tjenester som trenger mange musikkspor uten en ekstern pris per sang. Hvis poenget bare er å få én ferdig låt raskt, er en moden, driftet tjeneste fortsatt enklere enn å laste ned 57,4 GB og vedlikeholde CUDA-miljøet selv.

For lokale skapere er sammenligningen med Stable Audio 3 og andre åpne lydmodeller naturlig. MiniMax-Music3 går hardere etter komplette vokalsanger med tydelig makrostruktur. Det gjør maskinvarekravene tyngre, men også bruksområdet mer ambisiøst.

MiniMax har dessuten beveget seg raskt på tvers av medier. Selskapet har allerede sluppet modeller for tekst, bilder, video og lyd, og MiniMax H3 samler flere av disse medietypene i én videomodell. Music3 er mer spesialisert, og det er en styrke her: hele arkitekturen og promptformatet er rettet mot hvordan en sang utvikler seg over tid.

Jeg liker retningen. Ikke fordi alle nå bør kaste Suno, API-er og ferdige tjenester på sjøen, men fordi en reell åpen-vekt-modell for hele sanger gir oss et valg til. Du kan kjøre den lokalt, bygge den inn i egne arbeidsflyter og se nøyaktig hvilke begrensninger som gjelder. Bare les lisensen før du bygger produktet, og velg kjørevei etter maskinen du faktisk har.

Ofte stilte spørsmål

Kan MiniMax-Music3 lage vokal og instrumenter samtidig?

Ja. Modellen lager komplette sanger med vokal, instrumentering og arrangement fra sangtekst og en separat musikkbeskrivelse. SGLang-serveren gir 32 kHz, 16-bit stereo WAV, mens Diffusers leverer 44,1 kHz stereo direkte. Hvor nøyaktig den følger tekst, toneart og instrumentvalg er generativt og ikke garantert.

Kan MiniMax-Music3 kjøres på ett skjermkort?

Ja, gjennom Diffusers. Bfloat16-oppsettet bruker rundt 23 GB VRAM, automatisk CPU-offloading rundt 22 GB, og group offloading kan få modellen til å passe på 8 GB. Sistnevnte flytter modellag mellom minne og GPU og er derfor tregere.

Kan jeg bruke MiniMax-Music3 kommersielt?

Ja, men med vilkår. Produktet må vise «MiniMax-Music3» tydelig, og omsetning over 20 millioner dollar årlig – omtrent 190 millioner kroner – krever skriftlig tillatelse. Tjenester for andre brukere må også ha tiltak mot lisensbrudd og krenkende innhold.

Er MiniMax-Music3 gratis å laste ned?

Ja, modellvektene og inferenskoden kan lastes ned uten kjøpspris. Du må likevel dekke lagring, maskinvare og strøm selv, og følge Community License. Modellfilene er på omtrent 57,4 GB, så «gratis» betyr ikke at lokal drift er uten kostnader.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre i et mørkt videoredigeringsstudio med flere skjermer som viser LTX Video 2.3 frames fra en kafé-POV-scene

LTX Video 2.3 – 481 frames og 20 sekunder video på 2,5 minutt lokalt

LTX Video 2.3 (versjon 0.9.8) genererer 20 sekunder vertikal POV-video med 481 frames på 2 minutter og 26 sekunder på RTX 4090. Her er hva som er nytt, hva modellen krever, og hvorfor dette er den sterkeste lokale video-AI-modellen akkurat nå.