摘要

  • Black Forest Labs 推出了 FLUX 3 早期訪問版,這是其首個生成影片的模型,可產生長達 20 秒的片段,並配有同步音訊。
  • 相同的基礎架構驅動了 FLUX-mimic,這是一個與 mimic robotics 共同打造的機器人模型,Audi 已在生產線上進行測試。
  • 僅計劃在 2026 年稍後發布開放權重的「Dev」版本;影片和動作功能仍保留在 API 和合作夥伴存取之後,圖像功能將在未來幾週內跟進。

Black Forest Labs 於週四發布了 FLUX 3,這是該公司旗艦模型首次生成影片,而非僅生成靜態圖像。這家以 FLUX 系列圖像生成器聞名的德國 AI 實驗室,在一個共享系統中同時訓練了圖像、影片和音訊。

這就是所謂的多模態:一個模型同時學習多種資訊類型,而非將獨立的工具並排拼接。

影片功能是頭條亮點。FLUX 3 可產生長達 20 秒的片段,音訊與畫面同步生成——包括對話、音效和環境噪音。在早期評估中,人類審查員在 77% 的正面比較中偏好 FLUX 3 的輸出勝過 Runway Gen-4.5,在 93% 的比較中勝過 Luma Ray 3.2。它似乎略優於 Gemini Omni 和 Seedance,在 52% 的評估中擊敗了這些模型。

當然,這是一個偏好測試,而不是固定的評分標準:評估者只需觀看兩個片段,然後選擇看起來和聽起來更令人信服的那個,而 BFL 則統計 FLUX 3 獲勝的次數。

除此之外,該模型在靜態圖像上似乎也非常勝任,延續了其傳統。BFL 分享了一些圖像,FLUX 3 似乎非常多才多藝,能夠生成超越照片寫實主義的多種風格。

BFL 將其定位為不僅僅是一個內容工具。「一個只學習圖像的模型只能生成圖像,」聯合創始人兼 CEO Robin Rombach 說。該公司的賭注是,學習預測視頻也意味著學習其背後的物理原理——重量、接觸、時機——這正是機器在物理世界中移動所需的。

這個賭注有一個名字:FLUX-mimic。它與總部位於蘇黎世的 mimic robotics 合作構建,採用了 FLUX 3 的視頻預測引擎,並添加了一個輕量級的「解碼器」——一個小型附加組件,將模型內部對事物運動方式的感知轉化為實際的機器人動作。汽車製造商奧迪已經在測試它用於安裝柔性車門密封條等任務,這些工作是傳統自動化難以處理的。

「Audi 代表了我們打造 FLUX-mimic 時所設想的那種製造合作夥伴,」mimic 共同創辦人 Stephan-Daniel Gravert 表示。Audi 的 Christoph Schneider 則指出,這些機器人現在能夠「解決舊機器無法觸及的複雜軟體操控工作」。BFL 表示,整個系統的反應時間約為 101 毫秒,接近人類的視覺反射速度。

FLUX 的崛起並非憑空發生。Black Forest Labs 由曾協助在 Stability AI 打造原始 Stable Diffusion 模型的資深研究員於 2024 年 8 月創立,他們推出的 Flux 模型擊敗了 MidJourney,並超越了 Stability 自身表現不佳的 Stable Diffusion 3

開源的 Flux Dev 和 Schnell 模型奪得了「最佳開源影像生成器」的稱號,而 AI 藝術家原本預期 Stability 的改版作品 Stable Diffusion 3.5 最終能重新奪回這個寶座。

但它從未成功。FLUX 1.1 Pro 隨後在同年 10 月登頂 Artificial Analysis 影像競技場。不過,那個版本並非開源。

BFL 在 2025 年 11 月 發布了 FLUX.2,但並未像之前那樣受歡迎。原始 Flux 所持有的開源王冠一直持續到阿里巴巴的 Z-Image Turbo 在 2025 年底將其推翻,該模型在低階消費級顯示卡上達到了與其相當的品質。「這就是 SD3 本該達到的水準,」一位 CivitAI 用戶當時寫道。

FLUX 3 是 BFL 的回歸之作,但尚未完全開放。目前,影片和動作功能已透過 API 和特定合作夥伴(包括模仿機器人領域)提供早期存取,而圖像生成則根據 BFL 的說法「在未來幾週內」跟進。開放權重的 Dev 版本(BFL 計劃釋出供本地使用的唯一層級)預計要到 2026 年稍晚才會推出。