概要
- Black Forest Labs 已推出 FLUX 3 早期访问版,这是其首个生成视频的模型,可生成最长 20 秒且带有同步音频的片段。
- 相同的骨干网络还驱动了 FLUX-mimic,这是一个与 mimic robotics 合作构建的机器人模型,奥迪已在其生产线上进行测试。
- 只有开放权重的“Dev”版本计划于 2026 年晚些时候发布;视频和动作功能目前仍通过 API 和合作伙伴访问提供,图像功能将在未来几周内跟进。
Black Forest Labs 于周四发布了 FLUX 3,这是该公司旗舰模型首次生成视频而非仅生成静态图像。这家以 FLUX 系列图像生成器闻名的德国 AI 实验室,在一个共享系统中同时训练了图像、视频和音频。
这就是所谓的多模态:一个模型同时学习多种类型的信息,而不是将独立的工具拼凑在一起。
视频功能是主要亮点。FLUX 3 可生成最长 20 秒的片段,音频与画面同步生成,包括对话、音效和环境噪音。在早期评估中,人类评审员在 77% 的对比中更偏好 FLUX 3 的输出而非 Runway Gen-4.5,在 93% 的对比中更偏好其而非 Luma Ray 3.2。它似乎略优于 Gemini Omni 和 Seedance,在 52% 的评估中击败了这些模型。

当然,这是一个偏好测试,而不是固定的评分标准:评估者只需观看两个片段,然后选择看起来和听起来更令人信服的那个,BFL 统计 FLUX 3 获胜的次数。
除此之外,该模型在静态图像上似乎也非常出色,延续了其传统。BFL 分享了一些图像,FLUX 3 似乎非常全能,能够生成超越照片写实主义的多种风格。
BFL 将其定位为不仅仅是内容工具。“一个只学习图像的模型只能生成图像,”联合创始人兼 CEO Robin Rombach 说。该公司的赌注是,学习预测视频也意味着学习其背后的物理原理——重量、接触、时机——这正是机器在物理世界中移动所需的东西。
这个赌注有一个名字:FLUX-mimic。它与苏黎世的 mimic robotics 公司合作构建,采用 FLUX 3 的视频预测引擎,并添加了一个轻量级的“解码器”——一个小的附加组件,将模型内部对物体运动方式的理解转化为实际的机器人动作。汽车制造商奥迪已经在测试它,用于安装柔性车门密封条等任务,这些工作是传统自动化难以处理的。

“奥迪代表了我们为FLUX-mimic打造的制造合作伙伴类型,”mimic联合创始人Stephan-Daniel Gravert表示。奥迪的Christoph Schneider表示,这些机器人现在能够解决旧机器无法处理的“复杂软体操控工作”。BFL表示,整个系统的响应时间约为101毫秒,接近人类的视觉反射速度。
FLUX的崛起并非凭空发生。Black Forest Labs由曾帮助在Stability AI构建原始Stable Diffusion模型的资深研究人员于2024年8月创立,推出了超越MidJourney并优于Stability自身表现不佳的Stable Diffusion 3的Flux模型。
开源Flux Dev和Schnell模型获得了“最佳开源图像生成器”的称号,而AI艺术家曾期望Stability的翻新之作Stable Diffusion 3.5最终能夺回这一称号。
但它从未做到。FLUX 1.1 Pro随后在当年10月登顶Artificial Analysis图像竞技场。不过,那个版本并非开源。
BFL于2025年11月发布了FLUX.2,但并未像之前那样受欢迎。原始Flux持有的开源王冠一直持续到阿里巴巴的Z-Image Turbo在2025年底将其取代,在低端消费级显卡上匹配了其质量。“这就是SD3本应成为的样子,”当时一位CivitAI用户写道。
FLUX 3 是 BFL 的回归之作,但尚未完全开放。视频和动作功能目前通过 API 和特定合作伙伴(包括模仿机器人)提供早期访问,据 BFL 称,图像生成将在“未来几周内”跟进。开放权重的 Dev 版本是 BFL 计划发布的唯一供本地使用的版本,要到 2026 年晚些时候才会推出。






