Hjälp Nya Dagbladet att finnas kvar
Bild, film, ljud – och robotrörelser. Black Forest Labs nya FLUX 3 är byggd för att skapa och förstå allt i samma modell. Videoversionen finns redan i tidig åtkomst, medan en öppen modellvariant utlovas längre fram.
FLUX-familjen är sedan tidigare känd för bildgenerering. Med FLUX 3 tar det tyska AI-bolaget steget vidare till video med inbyggt ljud, bildredigering och förutsägelser av fysiska handlingar.
Tanken är att samma grundmodell ska lära sig hur världen ser ut, rör sig och låter – i stället för att behandla bild, video och ljud som separata problem. En ljudhändelse ska passa det som händer i filmen, en rörelse ska följa föremålets vikt och nästa bildruta ska vara en rimlig fortsättning på den förra.
Videomodellen kan enligt Black Forest Labs skapa klipp på upp till 20 sekunder med ljud i en enda generering. Den stöder text-till-video, bild-till-video, video-till-video, fortsättning av befintliga klipp, flerspråkig dialog och styrda övergångar mellan nyckelbilder.
Introducing FLUX 3.
One multi-modal model for Image, Video, Audio and Action-Prediction. Creations are truer to life in every kind of style.
FLUX 3 Video is now available in early access (link below).
Jointly trained in one unified architecture, our model can be extended to… pic.twitter.com/voQ5iUJJZY
— Black Forest Labs (@bfl_ai) July 23, 2026
Samma AI ska också kunna styra robotar
Den mest oväntade delen av lanseringen finns utanför bildskärmen. En tidig FLUX 3-version har byggts vidare till FLUX-mimic, en modell för robotrörelser som utvecklats tillsammans med mimic robotics och har testats i Audis produktion.
Resonemanget är att en modell som kan skapa trovärdig video redan måste lära sig något om kontakt, rörelse, vikt samt orsak och verkan. Samma förståelse kan sedan användas för att förutse hur en robotarm bör agera i den fysiska världen.
Black Forest Labs uppger att systemen hos Audi har klarat hantering av mjuka och flexibla föremål som varit svåra att automatisera med traditionellt programmerade robotceller. Uppgifterna kommer från bolagen själva och FLUX-mimic befinner sig fortfarande i ett tidigt skede.
Lovar öppna vikter
FLUX 3 Video erbjuds nu i tidig åtkomst. Bildgenerering, bildredigering och fler versioner ska rullas ut stegvis efter testning. Black Forest Labs planerar dessutom FLUX 3 Dev, där en multimodal grundmodell ska släppas med öppna vikter för skapande och handlingsprognoser. Något exakt datum har ännu inte angivits.
Det innebär att FLUX 3 kan bli mer än ännu en sluten videotjänst: utvecklare ska kunna bygga vidare på samma grund för bilder, filmer, ljud och robotik. Däremot gäller den öppna planen en kommande modellvariant, inte hela den tidiga videotjänsten.
I bolagets egna tidiga jämförelser föredrog testpersoner FLUX 3 framför Grok Imagine Video i 69 procent av fallen, Runway Gen-4.5 i 77 procent och Luma Ray 3.2 i 93 procent. Mot Gemini Omni Flash och Seedance 2.0 var resultatet 52 procent. Black Forest Labs betonar att utvärderingarna är preliminära och att både modellen och testmiljön fortfarande utvecklas.
Om satsningen håller vad den lovar kan FLUX 3 bli en ovanlig korsning: en kreativ studio för bild och film, en ljudmodell och en grund för robotstyrning – samlade i samma system.
Vilken aspekt av FLUX 3 är mest spännande enligt dig?
Röstning stängd
2 röster totalt
