Hvis du lager AI-video, er det lett å feste seg ved klipp på opptil 20 sekunder med lyd. FLUX 3 er likevel større enn enda en videomodell: Black Forest Labs bruker den samme grunnmodellen til bilde, video, lyd og robothandlinger.

Den praktiske videonyheten er støtte for referansebilder, videoreferanser og flere typer kontroll. Men det mest interessante ligger under selve videofunksjonen: BFL trener ikke fire separate modeller som tilfeldigvis har samme navn. Selskapet prøver å lære én modell hvordan verden henger sammen.

Det er en langt større ambisjon enn å vinne enda en sammenligning av pene videoklipp. FLUX-mimic, robotmodellen som bygger på den samme FLUX 3-ryggraden, er allerede testet på produksjonsoppgaver hos Audi. Der begynner lanseringen å bli virkelig interessant.

Hva er egentlig FLUX 3?

FLUX 3 er en multimodal grunnmodell som er trent på bilde, video og lyd i én felles arkitektur. Ifølge Black Forest Labs sin lansering 23. juli 2026 skal modellen lære rom, bevegelse, lyd og årsakssammenhenger som ulike uttrykk for den samme fysiske verden.

FLUX 1 og FLUX 2 var først og fremst familier for bildegenerering og bilderedigering. FLUX 3 flytter BFL inn i det samme brede feltet som Seedance 2.0, Gemini Omni, Grok Imagine Video, Runway og Kling. Forskjellen BFL fremhever, er at video, bilde, lyd og handlingsprediksjon springer ut av én multimodal ryggrad.

Det betyr ikke at én modellfil nødvendigvis skal gjøre absolutt alt på samme måte. Lanseringsplanen består av FLUX 3 Video, FLUX 3 Image, FLUX 3 Action, FLUX-mimic og en kommende FLUX 3 Dev med åpne vekter. Poenget er at variantene bygger på den samme grunnmodellen og den samme forståelsen av verden.

Dette er også et viktig skille fra FLUX 2, som jeg tidligere har vurdert i praktisk bildegenerering. En stor modell kan se glimrende ut på papiret og likevel være feil verktøy i en ekte arbeidsflyt. FLUX 3 må derfor vurderes ut fra hva den faktisk leverer når tilgangen blir bredere, ikke bare ut fra arkitekturen og de beste demonstrasjonene.

Illustrasjon av FLUX 3 som samler bilde, video, lyd og handling
FLUX 3 bygger bilde, video, lyd og handlingsprediksjon på den samme multimodale ryggraden.

Hva kan FLUX 3 Video gjøre?

FLUX 3 Video kan generere video med lyd på opptil 20 sekunder i én kjøring. Den støtter tekst-til-video, bilde-til-video, video-til-video, videreføring av video og lyd, overganger mellom nøkkelbilder og flerspråklig dialog, ifølge BFLs egen oversikt over funksjonene.

Det interessante for praktisk produksjon er bredden i input. Et bilde kan brukes som startbilde eller visuell referanse. Et videoklipp kan overføre sentrale elementer til en ny scene. Eksisterende video og lyd kan fortsettes, mens nøkkelbilder kan definere bestemte punkter i bevegelsen. Modellen skal også kunne sette sammen enkeltklipp til lengre sekvenser.

Dette er ikke unike funksjoner hver for seg. Seedance 2.0, Gemini Omni og Grok Imagine har allerede flyttet forventningene langt forbi enkel tekst-til-video. Verdien ligger i om FLUX 3 kan kombinere flere av kontrollformene uten at arbeidsflyten blir en stabel av forskjellige modeller og verktøy.

Opptil 20 sekunder i én generering er nyttig, men ikke det samme som en ferdig film på flere minutter. BFL sier at klipp kan kjedes sammen med visuelle referanser, men lange sekvenser må fortsatt vurderes på kontinuitet, kameraføring, lyd, fysikk og hvor mye manuelt arbeid som kreves mellom klippene. En god demonstrasjon er starten på testen, ikke slutten.

Slår den Seedance 2.0, Gemini Omni og Grok Imagine?

BFL oppgir at FLUX 3 ble foretrukket fremfor Grok Imagine Video i opptil 69 prosent av sammenligningene. Mot Seedance 2.0 og Gemini Omni Flash var tallet 52 prosent. Testene brukte 10 sekunder lange tekst-til-video-klipp i 720p med lyd, og BFL understreker selv at resultatene er foreløpige.

69 prosent mot Grok er et resultat det er verdt å følge med på. 52 prosent mot Seedance og Gemini Omni er derimot i praksis omtrent uavgjort, ikke dokumentasjon på at FLUX 3 har parkert konkurrentene. Vi kjenner heller ikke hele testoppsettet, antall vurderinger eller hvordan ulike typer bevegelse og lyd var fordelt.

Dette er dessuten leverandørens egen evaluering av en modell i Early Access. BFL oppgir også 60 prosent mot Kling v3 Pro, 77 prosent mot Runway Gen-4.5 og 93 prosent mot Luma Ray 3.2. Tallene forteller at FLUX 3 ser konkurransedyktig ut. De forteller ikke at modellen er best til alle oppgaver.

Min erfaring med videomodeller er at modellvalget bør følge klippet. Seedance 2 er særlig sterk på motion og action, mens andre modeller kan være bedre til andre deler av en produksjon. Derfor bruker jeg en miks og velger den rimeligste modellen som faktisk duger til hvert klipp. Jeg har samlet den praktiske vurderingen i sammenligningen av AI-videomodeller i 2026.

FLUX 3 kan endre den miksen, men først når vi vet mer om pris, API, køtid, stabilitet og resultatene på ekte oppgaver. BFL har foreløpig ikke publisert vanlig API-pris for FLUX 3 Video. Early Access betyr nettopp at produktet og verktøyene rundt det fortsatt utvikles.

Hvorfor blander BFL video og robotstyring?

BFLs tese er at en god videomodell må lære mer enn piksler. Over 95 prosent av beregningskostnadene under treningen av FLUX 3 skal ha gått til videoprediksjon, mens lyd utgjør under 0,5 prosent av tokenene i en 720p-video med lyd. Video tvinger modellen til å lære kontakt, vekt, bevegelse, tid og årsak.

Når en kopp faller, må bevegelsen følge tyngdekraften, sammenstøtet må passe med underlaget og lyden må komme på riktig tidspunkt. Handlingen til en robotarm er enda en måte å beskrive det samme forløpet på. Dermed blir handlingsprediksjon, i BFLs modell, en ny modalitet knyttet til den verden videomodellen allerede forsøker å forstå.

Arkitekturen bygger på Self-Flow, en metode fra BFL og MIT som kombinerer generering med læring av representasjoner. Målet er at de interne representasjonene både skal gi bedre generert innhold og være lettere å bruke til oppgaver som krever forståelse av hva som skjer i en scene.

Da BFL la handlingsprediksjon inn i treningen, falt menneskevurdert videokvalitet først med opptil 10 prosent. Etter 3 500 treningssteg var den tidligere videokvaliteten tilbake, samtidig som modellen kunne forutsi handlinger. Det er et viktigere arkitekturfunn enn en liten seier i en videoavstemning: samme ryggrad kunne lære robotens handlingsrom uten en varig svekkelse av videodelen.

Industrirobot bruker FLUX-mimic til å forutsi og utføre presise robothandlinger
FLUX-mimic bruker verdensrepresentasjoner fra videomodellen til å styre roboter i fysiske produksjonsoppgaver.

Hva har FLUX-mimic faktisk bevist?

FLUX-mimic er en video-action-modell utviklet av BFL og mimic robotics. I en test på sortering av myke deler oppnådde en forhåndsversjon 95 prosent suksess uten finjustering på akkurat den oppgaven, mot 55 prosent for en tilpasset pi0.5-variant og 70 prosent for en tungt ettertrent Flow Matching-baseline, ifølge mimic robotics sin tekniske presentasjon.

Robotmodellen genererer ikke en hel video før den bestemmer neste bevegelse. En kompakt action-decoder leser interne egenskaper fra videomodellens forestilling om hva som kommer til å skje. Dermed kan den hente ut robothandlinger i én gjennomkjøring av ryggraden, i stedet for å vente på en full videorendering.

I den optimaliserte løsningen kan FLUX-mimic gå fra input til verdensrepresentasjon på under 80 millisekunder på én RTX 5090. Hele robotsystemet skal reagere på 101 millisekunder når sensorer, modell, action-decoder og motorstyring regnes med. Det er fortsatt leverandørtall, men de svarer på et helt nødvendig spørsmål: Modellen er rask nok til å være relevant uten å sende hvert grep på en lang tur gjennom et datasenter.

BFL oppgir at FLUX 3 er trent på titalls millioner timer med generell video og hundretusenvis av timer med innhold rettet mot menneskelig og robotbasert manipulasjon. mimic har samlet data fra mer enn 100 ekte fabrikkoppgaver og tester systemet på blant annet sortering av deler, innsetting av elektronikk og håndtering av myke materialer som pakninger og kabler.

Det mest konkrete er samarbeidet med Audi. Robotene er testet og tatt i bruk på produksjonsoppgaver som tradisjonell automatisering har hatt problemer med. Det betyr ikke at en generell robotrevolusjon er ferdig levert. Det betyr at BFLs idé om å gjenbruke en videomodell som fysisk grunnmodell har kommet lenger enn en simulering og en pen forskningsgraf.

Hva betyr dette for deg som lager AI-innhold?

På kort sikt betyr FLUX 3 først og fremst en ny sterk kandidat for video med lyd og flere typer referanser. På lengre sikt er den viktige endringen at bilde, video, lyd og redigering kan bli ulike arbeidsflater mot den samme underliggende modellen. Det kan gjøre iterasjon enklere fordi modellen ikke må begynne helt på nytt når du går fra ett medium til et annet.

FLUX 3 Video er tilgjengelig i Early Access, mens FLUX 3 Image skal åpnes i ukene etter lanseringen. Video og lyd skal komme gjennom API og private vekter. BFL planlegger også FLUX 3 Dev som en multimodal modell med åpne vekter, men har ikke gitt en presis lanseringsdato, maskinvarekrav eller endelige lisensvilkår.

Det siste er verdt å merke seg. Åpne vekter kan gjøre FLUX 3 langt mer interessant for utviklere, forskning og spesialtilpasning enn en modell som bare finnes bak én lukket tjeneste. Men «kommer senere» kan ikke vurderes som om filene allerede ligger klare til nedlasting. Tilgang, størrelse og lisens avgjør hvor åpen og praktisk Dev-varianten faktisk blir.

Jeg ville derfor ikke kastet om på en fungerende videopipeline i dag. Grok Imagine Video 1.5 har sine klare bruksområder, og Seedance 2.0 forsvinner ikke fordi BFL fikk 52 prosent i sin egen tidlige måling. Det riktige nå er å følge Early Access, vente på priser og API-detaljer og sammenligne de samme klippene på tvers av modellene.

Den virkelige FLUX 3-nyheten er én felles ryggrad

FLUX 3 ser ut som en videolansering fordi video er det vi kan se og sammenligne med en gang. Men den viktigste nyheten er at BFL bruker den samme multimodale ryggraden til innhold og robothandlinger. FLUX-mimic gjør den påstanden konkret med målte resultater, lokal kjøring og produksjonsoppgaver hos Audi.

Det er fortsatt mye vi ikke vet. Prisene mangler, bred API-tilgang mangler, Dev-vektene er ikke ute, og videosammenligningene kommer fra BFL selv. Likevel er dette en stor lansering fordi selskapet har koblet en konkurransedyktig mediemodell til handling i den fysiske verden uten å bygge en helt separat grunnmodell.

Hvis FLUX 3 leverer like godt utenfor de utvalgte demonstrasjonene, får BFL noe mer verdifullt enn førsteplassen i et videodiagram. De får en grunnmodell som kan brukes til å se, forutsi, skape og handle. Det er et ganske stort sprang fra å lage bilder.

Ofte stilte spørsmål

Er FLUX 3 tilgjengelig for alle nå?

FLUX 3 Video er tilgjengelig gjennom Early Access, ikke som en ferdig, bredt tilgjengelig standardmodell. BFL planlegger senere API-tilgang, private vekter, en egen bildevariant og FLUX 3 Dev med åpne vekter. Selskapet har foreløpig ikke oppgitt en presis dato for hele utrullingen.

Kan FLUX 3 lage video med lyd?

Ja. FLUX 3 Video kan ifølge BFL generere opptil 20 sekunder lange videoer med lyd i én kjøring. Den støtter blant annet tekst, bilder, videoreferanser, videreføring av eksisterende video og lyd samt overganger mellom nøkkelbilder.

Er FLUX 3 bedre enn Seedance 2.0?

Det er ikke dokumentert ennå. I BFLs foreløpige leverandørtest ble FLUX 3 foretrukket i 52 prosent av sammenligningene mot Seedance 2.0. Det er best tolket som omtrent jevnt på akkurat 10 sekunder lange 720p-klipp, ikke som en sikker seier på tvers av oppgaver.

Hva er forskjellen på FLUX 3 og FLUX-mimic?

FLUX 3 er den multimodale grunnmodellen for bilde, video, lyd og handlingsprediksjon. FLUX-mimic er en spesialisert video-action-modell som bruker FLUX 3-ryggraden og en action-decoder til å styre roboter på fysiske oppgaver.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre styrer et digitalt kontrollpanel omgitt av Claude AI-symboler og glødende lysstriper i et mørkt rom

Claude AI – pris, funksjoner og norsk guide (2026)

Alt om Claude AI i 2026 – priser i norske kroner, Claude Pro vs Max, Claude Code, og ærlig sammenligning med ChatGPT. Komplett norsk guide fra en som bruker Claude daglig.
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.