重磅!黑森林实验室发布 FLUX 3:多模态流模型开启“真实世界模型”新时代
导读:黑森林实验室(Black Forest Labs)正式推出了全新多模态基础模型 FLUX 3。这一次,AI 不再仅仅理解孤立的图片或文本,而是走向了能够融合图像、视频、音频乃至物理动作预测的“真实世界模型”。以下为官方发布的完整深度解读:
这里是为您翻译并针对微信公众号排版风格优化后的文章,增加了符合公众号阅读习惯的引言与总结结尾:
迈向以多模态流模型为视觉智能支柱的时代
黑森林实验室(Black Forest Labs)| 2026年7月23日
FLUX 3 现已推出抢先体验版(Early Access)。
FLUX 3 是我们全新的多模态基础模型。它在统一的架构中联合学习图像、视频和音频,因为真实世界需要学习的并非孤立的单一元素。相反,模型必须学习对物理世界的整体表征:物体如何组合、事物如何运动,以及事件如何发出声音。
没有哪一种单一的感知方式能够提供完整的物理世界描述。每一种感知方式都是对同一潜在现实的投射,由不同的传感器捕捉,而每种传感器在捕捉过程中都会丢失一些信息:
- 图像:捕捉特定时间点的空间结构和关系。
- 视频:还原时间维度,揭示动态变化与物理定律。
- 音频:揭示视觉无法单独察觉的机械现象与声学因果关系。
- 语言:将这些感知与目标、抽象概念和指令联系起来。
学习其中一种模式,你只能获得该投射的局部模型;而同时学习所有模式,它们之间的相互制约关系会带来更深度的理解:声音必须与冲击力相匹配,运动必须服从质量,未来必须源于过去。各种模式不再彼此独立,而是成为同一潜在现实的互相佐证。
FLUX 3 是我们首个完全基于该原则构建的模型,也是我们开发真实世界视觉智能使命的一个重要里程碑——这些模型能够感知、预测并应对物理和数字环境。内容创作和物理人工智能(Physical AI)领域的早期成果表明,这条技术路线是完全正确的。
FLUX 3:一款模型,多种能力

FLUX 3 基于 Self-Flow 方法打造——这是我们在同一底层架构中高效整合多模态生成和理解的技术方案。基于此方法,我们显著扩展了计算和数据资源,从而能够同时训练 FLUX 3 处理视频、图像和音频数据。
一、 视频生成(Video)
FLUX 3 一次即可生成长度达 20 秒、伴有极其丰富音效/原声的视频。
其核心功能包括(所有输出均带有原生音频生成功能):
- 文本转视频(Text-to-Video)
- 图像转视频(Image-to-Video):既可以是起始帧的动态延续(“动画化”),也可以将图像作为视觉参考。
- 视频转视频(Video-to-Video):基于参考片段,将源视频的核心元素(例如同一角色)延续迁移到全新的场景或上下文中。
- 生成式视频-音频续写:基于输入的视频和音频进行自然延伸。
- 关键帧转视频(Keyframe-to-Video):在指定的明确时刻之间实现精准可控的过渡。
- 多语言对话生成
- 极其丰富的视觉风格与画幅比例:远超传统电影画幅的限制。
- Agent 级镜头串联:可将单个片段串联成更长的多镜头序列。
- 高度的风格多样性:轻松驾驭从逼真的家用摄像机纪实画面,到手绘动画和电影大片等各种风格。
- 强大的排版文字生成与动态设计能力

早期测试与性能评估
在初期测试中,我们生成了带音频的 10 秒 720p 文本转视频片段。根据初步评估对比显示:
- FLUX 3 在高达 69% 的对比中优于 Grok Imagine Video;
- 胜过 Kling v3 Pro(60%)、Happy Horse v1(59%)、Happy Horse 1.1(57%);
- 胜过 Seedance 2.0 和 Gemini Omni Flash(均占 52%);
- 在 77% 的对比中优于 Runway Gen-4.5,在 93% 的对比中优于 Luma Ray 3.2。
虽然模型仍在持续迭代中,但 FLUX 3 Video 在捕捉人类面部表情、将声音与物理事件精准关联、以及多语言能力方面表现尤其强劲。此外,这些能力可以组合使用,创作出长达数分钟的连续序列,并借助视觉参考确保角色在所有场景中保持高度一致。
二、 图像生成(Image)
FLUX 3 能够以极其丰富的风格、画幅比例和分辨率来合成与编辑图像。在中期训练的初步评估中,FLUX 3 较前代 FLUX 版本展现出了显著提升:其处理复杂 Prompt(提示词)和多语言文字渲染的精准度大幅增强,并能高质量呈现丰富多样的输出风格。
三、 动作预测与物理 AI(Action)
FLUX 3 对世界的理解延伸到了动作预测(Action Prediction)。为此我们探索了两条路径:
- 直接在 FLUX 3 中集成原生动作预测,进一步拓展 Self-Flow 的基础研究;
- 将预训练的视频骨干网络作为感知物理动态的基础,仅需少量任务特定数据,即可微调出专用的动作模型。
其中,Mimic Robotics 是最早获得 FLUX 3 早期使用权的合作伙伴之一。我们共同开发了 FLUX-mimic——这款视频动作模型将 FLUX 3 的核心架构与 Mimic 在机器人学习方面的专业知识结合,用于实现灵巧操作与实际生产部署。(相关技术论文已同步发表,展示了物理 AI 与内容生成如何基于同一底层架构,并在奥迪的实际生产任务中成功完成测试)。
推出计划与 Roadmap
在接下来的几周和几个月里,我们将陆续推出以下功能(均基于相同的底层多模态流量匹配/Flow Matching 模型):
- FLUX 3 Video:通过 API 和私有权重(Private Weights)提供视频与音频的生成及编辑。
- FLUX 3 Action / FLUX-mimic:与选定的研究及商业合作伙伴(首批为 Mimic Robotics)合作推进动作预测。
- FLUX 3 Image:通过 API 和私有权重提供图像合成与编辑能力。
- FLUX 3 Dev:开放多模态骨干网访问,用于内容创作(视频、音频、图像)及动作预测开发。

未来展望
我们目前对功能强大、用途广泛、统一的多模态模型及其未来潜力的探索才刚刚开始。从交互式图像与视频编辑、环境模拟,到计算机应用乃至物理 AI,其应用前景无比广阔。
在逐步推出这些新功能的同时,我们已经着手研发下一代模型——我们的终极目标是将感知、动作和语言预测完全融合在同一个统一模型之中。
💡 结语与思考
从文本生成图像,到全模态(音视频+动作)的原生流模型,AI 对真实物理世界的理解正在经历质的飞跃。FLUX 3 展现出的“音视频同源”与“机器人动作预测”能力,或许正预示着 AGI 在物理世界落地的全新方向。
你看好 FLUX 3 这种统一多模态的技术路线吗?欢迎在评论区留下你的看法!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)