W skrócie

  • Black Forest Labs udostępniło FLUX 3 we wczesnym dostępie – swój pierwszy model generujący wideo, tworzący klipy o długości do 20 sekund z zsynchronizowanym dźwiękiem.
  • Ten sam szkielet napędza FLUX-mimic, model robotyczny zbudowany z mimic robotics, który Audi już testuje na swojej linii produkcyjnej.
  • Planowana jest tylko wersja „Dev” z otwartymi wagami, która pojawi się później w 2026 roku; Wideo i Akcja pozostają na razie za API i dostępem partnerskim, a Obraz pojawi się w ciągu najbliższych tygodni.

Black Forest Labs wydało FLUX 3 w czwartek, i po raz pierwszy flagowy model firmy generuje wideo zamiast tylko statycznych obrazów. Niemieckie laboratorium AI, znane z linii generatorów obrazów FLUX, trenowało nowy system jednocześnie na obrazach, wideo i dźwięku, w ramach jednego wspólnego systemu.

To właśnie nazywa się multimodalnością: jeden model uczy się kilku rodzajów informacji razem, zamiast oddzielnych narzędzi połączonych obok siebie.

Strona wideo jest główną funkcją. FLUX 3 tworzy klipy o długości do 20 sekund, z dźwiękiem generowanym razem z obrazem i zsynchronizowanym z tym, co dzieje się na ekranie – dialogi, efekty dźwiękowe, hałas otoczenia. We wczesnych ocenach ludzcy recenzenci preferowali wyniki FLUX 3 nad Runway Gen-4.5 w 77% porównań bezpośrednich i nad Luma Ray 3.2 w 93%. Wydaje się, że jest nieco lepszy od Gemini Omni i Seedance, pokonując te modele w 52% ocen.

Oczywiście, to test preferencji, a nie stała rubryka oceny: ewaluatorzy po prostu oglądają dwa klipy i wybierają ten, który wygląda i brzmi bardziej przekonująco, a BFL liczy, ile razy FLUX 3 wygrywa.

Poza tym model wydaje się być bardzo kompetentny również w przypadku nieruchomych obrazów, kontynuując swoją tradycję. BFL udostępniło kilka obrazów, a FLUX 3 wydaje się być bardzo wszechstronny i zdolny do generowania szerokiej gamy stylów wykraczających poza fotorealizm.

BFL przedstawia to jako coś więcej niż narzędzie do tworzenia treści. „Model, który uczy się tylko obrazów, może generować tylko obrazy” – powiedział współzałożyciel i dyrektor generalny Robin Rombach. Zakład firmy jest taki, że nauka przewidywania wideo oznacza również naukę fizyki pod nim – wagi, kontaktu, czasu – czyli dokładnie tego, czego maszyna potrzebuje, aby poruszać się w świecie fizycznym.

Ten zakład ma nazwę: FLUX-mimic. Zbudowany we współpracy z zuryskim mimic robotics, wykorzystuje silnik przewidywania wideo FLUX 3 i dodaje lekki „dekoder” – mały komponent dodatkowy, który tłumaczy wewnętrzne odczucie modelu dotyczące ruchu rzeczy na rzeczywiste ruchy robota. Producent samochodów Audi już testuje go w zadaniach takich jak dopasowywanie elastycznych uszczelek drzwi, z którymi konwencjonalna automatyzacja miała trudności.

„Audi reprezentuje rodzaj partnera produkcyjnego, dla którego zbudowaliśmy FLUX-mimic” – powiedział współzałożyciel mimic, Stephan-Daniel Gravert. Christoph Schneider z Audi stwierdził, że roboty „rozwiązują teraz złożone zadania manipulacji miękkimi ciałami”, z którymi starsze maszyny nie mogły sobie poradzić. BFL twierdzi, że cały system reaguje w około 101 milisekund, co jest zbliżone do ludzkiego odruchu wzrokowego.

Wzrost FLUX nie nastąpił w próżni. Założona w sierpniu 2024 roku przez doświadczonych badaczy, którzy pomogli zbudować oryginalne modele Stable Diffusion w Stability AI, Black Forest Labs wypuściła modele Flux, które pokonały MidJourney i przewyższyły własny, rozczarowujący Stable Diffusion 3.

Modele open-source Flux Dev i Schnell zdobyły tytuł „najlepszego generatora obrazów open source”, który artyści AI spodziewali się, że ostatecznie odzyska Stable Diffusion 3.5, poprawiona wersja Stability.

Nigdy tego nie zrobił. FLUX 1.1 Pro w październiku tego samego roku zajął pierwsze miejsce w Artificial Analysis image arena. Ten model nie był jednak open source.

BFL wydało FLUX.2 w listopadzie 2025, ale nie był tak popularny. Korona open source, którą dzierżył oryginalny Flux, trwała do czasu, gdy Z-Image Turbo od Alibaby zdetronizował go pod koniec 2025 roku, dorównując jego jakości na tańszych kartach graficznych dla konsumentów. „To właśnie miał być SD3” – napisał wówczas jeden z użytkowników CivitAI.

FLUX 3 to powrót BFL i nie jest jeszcze w pełni otwarty. Wideo i Akcja są teraz dostępne we wczesnym dostępie przez API i wybranych partnerów, w tym mimic robotics, a generowanie obrazów nastąpi „w nadchodzących tygodniach” według BFL. Otwarta wersja Dev, jedyna warstwa, którą BFL planuje udostępnić do użytku lokalnego, nie pojawi się wcześniej niż w 2026 roku.