今天(8月20日),Black Forest Labs 的 FLUX 3 正式开放视频和动作预测的 Early Access。官网放了几段 demo,我反复看了好几遍——不是因为画面多惊艳,而是因为视频里的声音居然不是后期配的。海浪拍岸、脚步踩在砂石上、两个人对话,所有音频跟画面同步,从同一个模型里直接生出来的。

你可能觉得这没什么大不了的。但你要是用过 AI 做视频就知道了——以前你生成一段画面,再跑一个音频模型对嘴型,再调音轨对齐,三步走完发现口型跟声音差了两帧。那种痛苦,做过的人都懂。

FLUX 3 直接把"对嘴型"这个步骤干掉了。因为声音和画面是同一个模型同时生成的,天然同步。

以前各做各的,现在要一锅端

过去两年多模态生成的发展,基本是"各做各的"路线:文生图一个模型(Midjourney、DALL-E、FLUX 自己),文生视频另一个模型(Runway、Pika、Luma),音频生成再单独一个(ElevenLabs、AudioCraft)。你想做一个带声音的视频,至少得串三个模型,每一步对齐都在跟延迟和 artifact 搏斗。

FLUX 3 的做法完全不同。它把图像、视频、音频放在一起训练,不是简单的"拼盘式"拼接,而是真正的联合训练——同一套参数,同时学三种模态。官方博客里有一句话我印象很深:"没有哪一种单一模态能提供完整的描述,每一种都只是同一物理世界在不同传感器上的投影。"

这个思路其实不新鲜。学术界讨论"统一多模态"好几年了,但真正敢在工程上干出来的,BFL 是第一个。为什么?因为太难了。图像、视频、音频的数据量级差好几个数量级——视频一秒 24 帧,音频一秒 44.1k 采样点,文本一秒才几个 token。把它们放进同一个 loss 里训练,配比稍微不对,模型就"偏科"。

Self-Flow 架构:不是把三个模型绑在一起

FLUX 3 的底子是 Self-Flow,一种 flow matching 的统一框架。跟传统做法最大的区别是:它没有为每种模态单独设计 encoder-decoder,而是让所有模态共享同一个 backbone,通过自适应路由来决定当前任务更依赖哪种模态的信息。

我打个比方。传统做法像是请三个大厨,一个做川菜、一个做粤菜、一个做西餐,你想吃一桌菜,三个大厨各做各的,最后摆在一起。FLUX 3 的做法是请一个全能主厨,他一个人同时会做三个菜系,而且他知道什么时候该用川菜的辣、什么时候该用粤菜的鲜——因为菜是同一个锅炒出来的,味道自然融合。

在技术指标上,FLUX 3 的表现也经得起看。Human preference 评测中,10 秒 720p 文生视频带音频,FLUX 3 以 77% 的偏好率击败 Runway Gen-4.5,以 93% 击败 Luma Ray 3.2。不过跟 Seedance 2.0 打平(52%),说明顶级视频生成还有差距。

但我觉得,FLUX 3 真正的价值不在单点指标,而在"一个模型"这件事本身。当所有模态共享同一个表征空间,跨模态的迁移学习和涌现能力就有了基础。比如,模型从大量视频中学到了"物体落下会发出声音"这个物理常识,那它做图像生成时,可能就对"物体之间的物理关系"有更好的理解。

统一不是万能药,但方向是对的

说实话,FLUX 3 目前还不是完全体。它视频做了 20 秒、720p,音频质量还不错,但跟专精的模型比有明显妥协——图像质量不如 FLUX 自己之前的版本,音频细节不如 ElevenLabs 的专用模型。这是"统一"的代价,不可能既要又要。

但 BFL 的路线图很清晰:FLUX 3 Image 和开源权重后续会跟上,而且 FLUX-mimic 已经在奥迪的工厂里测试机器人动作预测了。从生成视频到控制机器人,中间只隔了一套共享参数——这个跨度比大多数人想象的要小。

与此同时,统一多模态的另一条路也在走。8月14日小红书开源了 dots3-note,280B 参数、16B 激活的 MoE 多模态模型,能理解文本、图像、视频、音频四种输入,专攻"长程智能体"任务——规划旅行、筹备婚礼、开店经营,一做就是几小时甚至几天。dots3 走的不是"生成一切",而是"理解一切并执行任务"。

两条路线:FLUX 3 是"一个模型生成一切",dots3 是"一个模型理解一切并执行"。它们不冲突,甚至可能在未来汇合——当你既能理解又能生成,你就接近了一个真正理解世界的多模态系统。

统一之后,然后呢?

我比较好奇的是,当多模态模型真正统一之后,AI 的能力边界会往哪移。

一个很直接的推论:如果 FLUX 3 能生成带声音的视频,那它离"理解视频"还有多远?Self-Flow 架构本身就具备双向能力——生成和理解共享同一个表征空间。BFL 目前只开放了生成侧,但给机器人做动作预测时,模型必须先理解视觉输入才能预测动作。这说明理解能力已经内建了,只是还没作为产品开放。

另一个有意思的方向是"世界模型"。FLUX 3 的完整名称是 "Real World Models",BFL 的野心不只是做生成工具,而是让模型学会物理世界的运作规律——物体怎么运动、声音怎么传播、事件怎么因果关联。这些能力一旦建立,生成只是"副产品"。

当然,这些都是展望。眼下 FLUX 3 还只是个 Early Access 的视频生成模型,音频质量有提升空间,图像生成还没完全开放。但它的架构方向,让我觉得多模态 AI 终于从"各做各的"进入了"统一"的实质性阶段。

你觉得统一多模态是终局趋势,还是垂直专精的模型永远会有一席之地?如果有一个模型既能生成高质量视频,又能理解复杂任务,你最想拿它来做什么?评论区聊聊。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐