AI 前沿·阅读约 2 分钟·
Black Forest Labs 发布 FLUX 3:统一图像、视频和音频的多模态流模型

Black Forest Labs 发布 FLUX 3:统一图像、视频和音频的多模态流模型

Black Forest Labs 正式发布 FLUX 3,基于 Self-Flow 技术架构统一处理图像、视频和音频三种模态,支持生成最长 20 秒带原生音频的视频,早期评测在多款竞品中胜出

原文来源:Black Forest Labs Blog — Black Forest Labs 正式推出 FLUX 3,一个统一处理图像、视频和音频的多模态流匹配模型,支持带原生音频的 20 秒视频生成,同时开放早期访问。

Black Forest Labs 发布了 FLUX 3,这是其生成式 AI 模型的重大升级。与之前的版本不同,FLUX 3 不再只是一个图像生成模型——它统一了图像、视频和音频三种模态,在一个架构中同时学习"世界是如何运作的"。

核心理念:多模态是通往世界模型之路

FLUX 3 的出发点是:没有任何单一模态能完整描述现实世界,每种模态都是同一真实的不同投影。图像告诉物体长什么样,视频记录它们如何运动,声音则揭示碰撞和质感。FLUX 3 同时学习这三种信号,让它们互相约束——声音必须匹配撞击的力度,运动必须遵循物体的质量,未来必须服从过去的规律。

这意味着模型底层建立的是一个关于世界的表征,而不仅仅是像素的统计规律。这与 Black Forest Labs 的技术目标一脉相承:将生成模型从"画图工具"升级为"视觉智能的基础设施"。

—— 广告 ——

技术基础:Self-Flow 架构

FLUX 3 基于团队此前发表的 Self-Flow 论文构建。与传统的 Flow Matching 相比,Self-Flow 在多模态生成和理解的对齐上效率更高。初步研究数据显示:

  • 生成误差(Fréchet 距离):各模态下均低于普通 Flow Matching
  • 操控任务成功率:平均高于 Flow Matching

计算和数据资源相比 FLUX 2 有显著扩充——这次是同时扩展视频、图像和音频三路的训练规模。

视频生成能力:最长 20 秒,带原生音频

FLUX 3 的视频能力是这次发布的核心亮点。它可以生成最长 20 秒的带原生音频视频,支持多种生成模式:

  • 文生视频:从文字描述直接生成视频+音频
  • 图生视频:从起始帧或视觉参考生成动画
  • 视频生视频:保留主角等核心元素进入新场景
  • 生成式视频-音频续写:从已有视频+音频延续生成
  • 关键帧到视频:在指定的关键帧之间生成过渡
  • 多语言对话:支持多语言角色对话
  • Agentic 链式生成:自动将多个片段合成更长序列
  • 文字渲染:视频中的多语言文字生成能力大幅提升

偏好评测对比

在 10 秒 720p 带音频的视频偏好测试中,FLUX 3 的表现如下:

对比模型FLUX 3 偏好率
Grok Imagine Video69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%
Runway Gen-4.577%
Luma Ray 3.293%

Black Forest Labs 坦言视频能力仍在开发中,但特别指出 FLUX 3 在捕捉人类面部表情声音与物理事件的匹配以及多语言能力上已经表现出明显的优势。

图像生成:迭代升级

图像生成方面,FLUX 3 仍保持了对多种风格、宽高比和分辨率的广泛支持。中期评估显示相比之前的 FLUX 版本有明显提升,尤其是在多语言文字渲染复杂 Prompt 处理上。图像生成的早期访问将在未来几周开放。

动作预测:从内容生成到物理世界

FLUX 3 最让人意外的是其动作预测能力。团队探索了两条路径:

  1. 原生动作预测:直接在 Self-Flow 扩展框架中集成
  2. 视频骨干作为动力学基础:将预训练的视频骨干作为具备动力学感知的基础模型,再微调为专用动作模型

mimic robotics 合作开发的 FLUX-mimic 已经展示了这个方向的可能性。他们将 FLUX 3 的骨干网络与 mimic 的灵巧操作能力结合,在 Audi 的真实生产任务上进行了测试。这意味着内容生成和物理 AI 可能共享同一个底层基础——一个能同时生成视频和预测物理行为的世界模型。

发布计划

能力访问方式状态
视频与音频生成/编辑API + 私有权重访问("FLUX 3 Video")早期访问已开放
动作预测选定研究及商业合作伙伴("FLUX-mimic & FLUX 3 Action")从 mimic robotics 启动
图像合成与编辑API + 私有权重访问("FLUX 3 Image")未来几周开放
开放权重多模态骨干开放权重("FLUX 3 Dev")未来

所有能力均基于同一底层多模态流匹配模型构建。

展望

Black Forest Labs 表示已在推进下一代模型,目标是在同一个模型中统一感知、动作和语言预测。FLUX 3 的发布标志着生成式 AI 从"单一模态生成"向"多模态世界模型"迈出了实质性的一步。未来交互式图像与视频编辑、仿真环境、计算机使用乃至物理 AI,都可能建立在这一统一架构之上。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/flux-3