
Black Forest Labs 发布 FLUX 3:统一图像、视频和音频的多模态流模型
Black Forest Labs 正式发布 FLUX 3,基于 Self-Flow 技术架构统一处理图像、视频和音频三种模态,支持生成最长 20 秒带原生音频的视频,早期评测在多款竞品中胜出
原文来源:Black Forest Labs Blog — Black Forest Labs 正式推出 FLUX 3,一个统一处理图像、视频和音频的多模态流匹配模型,支持带原生音频的 20 秒视频生成,同时开放早期访问。
Black Forest Labs 发布了 FLUX 3,这是其生成式 AI 模型的重大升级。与之前的版本不同,FLUX 3 不再只是一个图像生成模型——它统一了图像、视频和音频三种模态,在一个架构中同时学习"世界是如何运作的"。
核心理念:多模态是通往世界模型之路
FLUX 3 的出发点是:没有任何单一模态能完整描述现实世界,每种模态都是同一真实的不同投影。图像告诉物体长什么样,视频记录它们如何运动,声音则揭示碰撞和质感。FLUX 3 同时学习这三种信号,让它们互相约束——声音必须匹配撞击的力度,运动必须遵循物体的质量,未来必须服从过去的规律。
这意味着模型底层建立的是一个关于世界的表征,而不仅仅是像素的统计规律。这与 Black Forest Labs 的技术目标一脉相承:将生成模型从"画图工具"升级为"视觉智能的基础设施"。
—— 广告 ——
技术基础:Self-Flow 架构
FLUX 3 基于团队此前发表的 Self-Flow 论文构建。与传统的 Flow Matching 相比,Self-Flow 在多模态生成和理解的对齐上效率更高。初步研究数据显示:
- 生成误差(Fréchet 距离):各模态下均低于普通 Flow Matching
- 操控任务成功率:平均高于 Flow Matching
计算和数据资源相比 FLUX 2 有显著扩充——这次是同时扩展视频、图像和音频三路的训练规模。
视频生成能力:最长 20 秒,带原生音频
FLUX 3 的视频能力是这次发布的核心亮点。它可以生成最长 20 秒的带原生音频视频,支持多种生成模式:
- 文生视频:从文字描述直接生成视频+音频
- 图生视频:从起始帧或视觉参考生成动画
- 视频生视频:保留主角等核心元素进入新场景
- 生成式视频-音频续写:从已有视频+音频延续生成
- 关键帧到视频:在指定的关键帧之间生成过渡
- 多语言对话:支持多语言角色对话
- Agentic 链式生成:自动将多个片段合成更长序列
- 文字渲染:视频中的多语言文字生成能力大幅提升
偏好评测对比
在 10 秒 720p 带音频的视频偏好测试中,FLUX 3 的表现如下:
| 对比模型 | FLUX 3 偏好率 |
|---|---|
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
| Runway Gen-4.5 | 77% |
| Luma Ray 3.2 | 93% |
Black Forest Labs 坦言视频能力仍在开发中,但特别指出 FLUX 3 在捕捉人类面部表情、声音与物理事件的匹配以及多语言能力上已经表现出明显的优势。
图像生成:迭代升级
图像生成方面,FLUX 3 仍保持了对多种风格、宽高比和分辨率的广泛支持。中期评估显示相比之前的 FLUX 版本有明显提升,尤其是在多语言文字渲染和复杂 Prompt 处理上。图像生成的早期访问将在未来几周开放。
动作预测:从内容生成到物理世界
FLUX 3 最让人意外的是其动作预测能力。团队探索了两条路径:
- 原生动作预测:直接在 Self-Flow 扩展框架中集成
- 视频骨干作为动力学基础:将预训练的视频骨干作为具备动力学感知的基础模型,再微调为专用动作模型
与 mimic robotics 合作开发的 FLUX-mimic 已经展示了这个方向的可能性。他们将 FLUX 3 的骨干网络与 mimic 的灵巧操作能力结合,在 Audi 的真实生产任务上进行了测试。这意味着内容生成和物理 AI 可能共享同一个底层基础——一个能同时生成视频和预测物理行为的世界模型。
发布计划
| 能力 | 访问方式 | 状态 |
|---|---|---|
| 视频与音频生成/编辑 | API + 私有权重访问("FLUX 3 Video") | 早期访问已开放 |
| 动作预测 | 选定研究及商业合作伙伴("FLUX-mimic & FLUX 3 Action") | 从 mimic robotics 启动 |
| 图像合成与编辑 | API + 私有权重访问("FLUX 3 Image") | 未来几周开放 |
| 开放权重多模态骨干 | 开放权重("FLUX 3 Dev") | 未来 |
所有能力均基于同一底层多模态流匹配模型构建。
展望
Black Forest Labs 表示已在推进下一代模型,目标是在同一个模型中统一感知、动作和语言预测。FLUX 3 的发布标志着生成式 AI 从"单一模态生成"向"多模态世界模型"迈出了实质性的一步。未来交互式图像与视频编辑、仿真环境、计算机使用乃至物理 AI,都可能建立在这一统一架构之上。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/flux-3
相关文章
GPT-5.6 Sol / Terra / Luna:OpenAI 发布新一代模型家族,三档定价覆盖全场景
OpenAI 发布 GPT-5.6 系列,包含旗舰 Sol、均衡 Terra 和高速 Luna 三款模型,编码能力突破 Terminal-Bench 91.9%,并推出更透明的安全机制
Anthropic 发布 Claude Opus 5:近 Fable 级别的智能,一半的价格
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,全新旗舰模型在编码、科学研究和知识工作等多项基准上超越前代 Opus 4.8 近两倍性能,定价仅为 Fable 5 的一半
Anthropic 发现 Claude 内部存在「全局工作空间」——意识级思考可被实时观测与操控
Anthropic 发布重磅可解释性研究:Claude 在训练过程中自发涌现出类似人脑的「全局工作空间」(J-space),占据不到 10% 的神经活动,却承担着多步推理、计划和内部监控等高级认知功能。研究者还开发了 Jacobian Lens 工具,可以实时读取和操控这个内部空间。