黑森林实验室推出 FLUX 3 AI,可生成 20 秒视频

Key Takeaways
  • Black Forest Labs 周四推出 FLUX 3,这是其首次生成视频而非静态图像。
  • FLUX 3 生成时长 20 秒、带同步音频的视频剪辑,在 77% 的评估中表现优于 Runway Gen-4.5。
  • Audi 正在测试 FLUX-mimic,该产品使用 FLUX 3 的引擎构建,用于在生产线上对柔性门封条进行适配。

Black Forest Labs 于周四发布 FLUX 3,标志着该公司旗舰模型首次生成视频而非静态图像。该德国 AI 实验室以其 FLUX 系列图像生成器而闻名,新的系统在同一个共享系统内同时使用图像、视频和音频进行训练。这种多模态方法使 FLUX 3 能生成最长 20 秒的剪辑,并在画面旁生成音频,且与屏幕上的动作同步,包括对话、音效和环境噪声。此次发布体现出从纯图像生成向视频能力的战略转变。模型还为 FLUX-mimic 提供支持,这是一个机器人应用,已在奥迪的生产线上接受测试,用于诸如安装可弯曲门封条之类的任务。

FLUX 3 交付带同步音频的 20 秒视频剪辑

FLUX 3 生成最长 20 秒的视频剪辑,音频与画面同步生成,并与屏幕上正在发生的内容保持一致。在早期评估中,人类评审在 77% 的两两对比中更偏好 FLUX 3 的输出,相较之下是 Runway Gen-4.5;在 93% 的对比中更偏好其输出,相较之下是 Luma Ray 3.2。该模型在 52% 的评估中击败 Gemini Omni 和 Seedance。在这些偏好测试中,评估者会观看两个剪辑,并选择看起来与听起来更具说服力的那一个;Black Forest Labs 统计 FLUX 3 获胜的次数。

该模型也展示了生成静态图像的能力,延续其在图像生成方面的传统。Black Forest Labs 分享了展示图像,表明 FLUX 3 的多样性,能够在逼真度之外产出各种风格的广泛组合。联合创始人兼首席执行官 Robin Rombach 表示:“一个只学习图像的模型,只能生成图像。”公司认为,学习预测视频同样意味着学习其下层的物理机制——重量、接触、时序——而这正是机器需要去穿越物理世界的东西。

奥迪在生产线上测试 FLUX-mimic 机器人系统

FLUX-mimic 由基于苏黎世的 mimic 机器人构建,它将 FLUX 3 的视频预测引擎与一个轻量解码器结合——一种小型附加组件,将模型内部对事物如何运动的感知转化为实际的机器人动作。奥迪正在将其用于诸如安装可弯曲门封条之类的任务,而这类工作是传统自动化难以处理的。mimic 联合创始人 Stephan-Daniel Gravert 表示:“奥迪代表了我们为 FLUX-mimic 构建的那类制造业合作伙伴。”奥迪的 Christoph Schneider 表示,这些机器人现在能够“解决更复杂的软体操控工作”,而更老的机器无法触及。Black Forest Labs 称,整个系统的反应时间约为 101 毫秒,接近人类视觉反射的量级。

Black Forest Labs 在 Stable Diffusion 早期基础上构建 FLUX 3

Black Forest Labs 于 2024 年 8 月成立,由资深研究人员创办,这些研究人员曾在 Stability AI 帮助构建最初的 Stable Diffusion 模型。该公司推出的 Flux 模型在表现上胜过 MidJourney,并超越了 Stability 的 Stable Diffusion 3。开源的 Flux Dev 和 Schnell 模型拿下了“A I 艺术家原本期待 Stable Diffusion 3.5 能夺回的‘最佳开源图像生成器’”这一称号。FLUX 1.1 Pro 于 10 月在 Artificial Analysis 的图像竞技场中夺冠,尽管该版本并非开源。

Black Forest Labs 于 2025 年 11 月发布 FLUX.2,但它并不那么受欢迎。由最初 Flux 所持有的开源桂冠一直持续到 2025 年末,当时阿里巴巴的 Z-Image Turbo 将其取代,并在低端消费级显卡上实现了与其相当的质量。当时一位 CivitAI 用户写道:“这才是 SD3 本该成为的样子。”

计划于 2026 年后期推出的开发版

视频与动作目前通过 API 和部分合作伙伴提供早期访问,其中包含 mimic 机器人。Black Forest Labs 表示,图像生成将“在接下来的几周内”进行。开源权重的 Dev 版本是 Black Forest Labs 计划为本地使用发布的唯一档位,预计要到 2026 年后期才会推出。

常见问题

FLUX 3 提供哪些视频能力?
FLUX 3 生成最长 20 秒的视频剪辑,音频与画面同步生成,并与屏幕上的动作保持一致,包括对话、音效和环境噪声。在早期评估中,人类评审在 77% 的对比中更偏好 FLUX 3 的输出,相较于 Runway Gen-4.5,并在 93% 的对比中更偏好其输出,相较于 Luma Ray 3.2。

奥迪如何在生产线上使用 FLUX-mimic?
奥迪正在测试 FLUX-mimic 用于诸如安装可弯曲门封条之类的任务,而这类工作是传统自动化难以处理的。该系统由 mimic 机器人构建,将 FLUX 3 的视频预测引擎转化为实际机器人动作,反应时间约为 101 毫秒。奥迪的 Christoph Schneider 表示,这些机器人现在能够解决更复杂的软体操控工作,而更老的机器无法触及。

FLUX 3 的开源权重 Dev 版本何时可用?
开源权重的 Dev 版本是 Black Forest Labs 计划为本地使用发布的唯一档位,预计要到 2026 年后期才会推出。目前视频与动作已通过 API 和部分合作伙伴提供早期访问,图像生成则将于接下来的几周内跟进。

免责声明:本页面信息可能来自第三方,仅供参考,不代表 Gate 的观点或意见,亦不构成任何财务、投资或法律建议。数字资产交易风险较高,请勿仅依赖本页面信息作出决策。具体内容详见声明
评论
0/400
暂无评论