8月3日到8月6日,四天之内,MiniMax H3开源登顶Hugging Face、字节跳动连续发布Seedance 2.5和SeedRealtime、商汤推出SenseNova U1.5-Lite-Preview、京东开源JoyAI-Video-Edit、Sand.ai抛出全球首个千亿级MoE视频模型——整整六款多模态产品密集落地,覆盖从文生视频、实时音视频交互到视频编辑的每一个细分赛道。这不是巧合,这是一场"统一战争"的开端。

一、"以前是各做各的,现在要一统天下"

多模态AI的发展路径,过去三年一直沿着一条清晰的"分裂"路线前进:文生图一个模型、图生视频另一个模型、视频编辑又一个模型、音频生成还需要单独部署。开发者要做一个带声音的视频生成应用,至少需要串联3-4个不同模型,每个模型有各自的输入格式、推理环境和输出规范。这种"拼积木"式的架构,既不高效也不稳定——中间环节的精度丢失和延时累积,让很多创意产品的实际体验远低于Demo。

2026年8月的这波发布,最大的共同特征是"统一"。

MiniMax H3是第一款真正意义上的"全模态生成系统"。它接收的是由文本、图像、视频、音频混排而成的多模态上下文,输出的是带原生双声道立体声的视频。不需要先文生图再图生视频再配音轨——一次推理,全部完成。字节的Seedance 2.5同样采用了统一的多模态音视频联合生成架构,并且把单次生成的时长拉到了30秒。更值得注意的是,8月6日发布的SeedRealtime,把统一架构推向了实时交互——音频、视频、文本原生融合,用户对着摄像头说话,模型能同时理解语音、表情、动作和画面内容,并实时生成回应。

商汤的SenseNova U1.5-Lite-Preview则走了另一条"统一"路线。它用8B-MoT的轻量级参数,在同一架构中贯通了视觉理解、推理、生成与编辑。不是"能生成又能理解",而是"理解本身就是生成的一部分"——模型在理解图像内容的同时,就已经具备了编辑和重建它的能力。这种架构设计,比简单的"多任务统一"更接近人类视觉认知的本质。

二、为什么是现在?三条技术线索的汇合

这波"统一"浪潮来得如此集中,不是偶然的市场炒作,而是三条技术线索同时到达临界点的结果。

线索一:MoE架构让"大而全"变得可行。 统一的代价是模型参数量的膨胀。一个纯文本模型只需要处理离散的token,但一个多模态模型需要同时处理图像patch、视频帧、音频波形,数据维度是文本的几百倍。Sand.ai发布的全球首个千亿级MoE视频模型,证明了MoE的路由机制可以有效地把计算资源分配给最需要的那部分模态——当输入是纯文本时,视觉和音频的专家模块保持静默,几乎不消耗算力。这种"按需激活"的设计,让统一模型的经济账第一次算得过来。

线索二:开源生态的力量正在反哺基础模型。 MiniMax H3在发布当天就宣布开源,随后16家芯片厂商同日完成适配,RunningHub在数小时内就完成了ComfyUI节点的接入。京东的JoyAI-Video-Edit同样选择了开源路线。这种"模型即平台"的思路,让统一模型不再局限于API调用,而是可以嵌入到任何开发者的工作流中。开源社区的正反馈机制——更多人用→更多Bug被修→更多适配完成→更多人用——正在加速统一模型的成熟周期。

线索三:全双工架构从语音扩展到多模态。 字节的SeedRealtime是"全双工"概念在AI领域的里程碑式落地。如果说传统AI交互是"你说一句,AI回一句"的半双工模式,那么全双工就意味着用户和AI可以同时表达和接收信息——用户一边说一边做手势,AI一边听一边看一边回应。这种交互模式对多模态理解的要求是质变的:模型必须实时处理并行的多路信号,而不是串行地"听完了再分析图像"。SeedRealtime的发布,意味着多模态统一模型已经从"离线生成"进入了"实时交互"的新阶段。

三、"统一"之后,意味着什么?

模型架构的统一,正在引发连锁反应,改变整个多模态AI的产业格局。

第一,应用层的"串并联"成本将大幅下降。 过去做一个AI视频产品,开发团队需要同时维护多个模型的API对接、处理不同格式的兼容问题、优化多模型串联的延迟。统一模型的出现,意味着"一次接入、全模态覆盖"。这个变化对创业公司尤其友好——团队规模可以更小,产品迭代可以更快。可以预见,未来三个月内,基于统一多模态模型的新型创意工具会密集涌现,竞争会从"谁的模型串联得好"变成"谁的产品体验更好"。

第二,算力竞争将从"总量"转向"效率"。 统一模型虽然参数更大,但MoE架构的"按需激活"特性,意味着实际推理时的算力消耗并不一定等比增长。Sand.ai的千亿级MoE模型就证明了这一点。这给算力资源有限的团队提供了弯道超车的机会——不是谁的GPU多谁就赢,而是谁的模型路由效率高、谁的计算调度做得好,谁就能在有限的算力预算下跑出更好的效果。

第三,多模态内容的"原生"和"后制"边界正在模糊。 京东JoyAI-Video-Edit的实时编辑能力,让"视频观看"和"视频编辑"可以同时发生。你看着一段视频,觉得背景不对,随口说一句"换成海边",画面就实时变化。这听起来像科幻,但技术上已经落地了。当生成和编辑不再有明确的先后顺序,内容创作的逻辑将被彻底改写——不再是"先拍完再剪辑",而是"边看边改、边生成边编辑"。

四、一个尚未被充分讨论的问题:统一模型的天花板在哪?

统一多模态模型在快速进化,但有两个结构性问题值得关注。

一是模态之间的"分辨率冲突"。 文本的token是离散的、语义稠密的,而图像的像素是连续的、语义稀疏的。当模型在同一架构中处理这两种信号时,注意力机制天然会偏向语义更稠密的文本token,导致视觉细节的丢失。MiniMax H3和Seedance 2.5都在通过"模态感知的注意力掩码"来缓解这个问题,但还没有从根本上解决。这个问题在视频生成中尤其明显——画面越复杂,文本描述越难以精确控制每个像素的行为。

二是"统一"和"特化"之间的张力。 统一模型的优势在于通用性,但代价是专业任务的性能天花板。一个专门做文生图的模型,在图像质量上几乎总是优于统一模型中的图像生成模块。这就像是"瑞士军刀"和"专业厨刀"的区别——旅行时瑞士军刀更方便,但真要切菜你还是会选专业厨刀。对于大多数创意工作者来说,这个取舍可能意味着"统一模型做初稿、专业模型做精修"将成为常态。

五、结语

8月第一周的多模态大爆发,不是产品层面的内卷,而是技术路线的集体转向。"统一"已经成为下一个阶段的关键词——不是某个公司的战略选择,而是整个行业的技术共识。

但统一之后的问题,比统一本身更值得思考。当模型把文本、图像、视频、音频全部"打通",内容创作的边界在哪里?当AI可以实时理解并生成多模态信息,人机交互的形态会变成什么?当"生成"和"编辑"不再有先后之分,我们关于"创作"的定义是否需要重新书写?

这些问题没有标准答案,但有一个方向是确定的:多模态AI的"统一战争"刚刚开始,而我们每个人都是这场战争的参与者和见证者。

你最近在用哪个多模态模型?在统一和特化之间,你会怎么选?

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐