9月15日,智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0。该模型采用智象自研原生全模态架构,支持文本、图片、视频等多种模态输入,可一键直出 5-20 秒 1080p 高保真视频,并在意图理解、物理规律理解、自主规划叙事、音画一体化生成等维度全面升级,达到全球领先水平。

双榜亮相,全球第一梯队迎来新成员

在两项国际权威评测中,HiDream-O1-Video-1.0 均位居世界前列。全球领先的独立 AI 基准测试与分析平台 Artificial Analysis Image to Video Leaderboard(With Audio)上,HiDream-O1-Video-1.0 取得全球第四。该榜单以标准化、可复现的基准对全球头部视频生成模型进行系统评测,被视为衡量 AI 视频模型综合实力的重要标尺。

在全球最具影响力的 AI 模型盲测评测平台 Arena.ai Image-to-Video 中,HiDream-O1-Video-1.0 取得第 8 的优异成绩。Arena.ai Image-to-Video 专注 AI 视频生成模型的盲测评测,是目前评估图生视频模型能力的重要第三方参考,被国际主流 AI 厂商广泛引用。

放在全球 AI 竞争格局中看,多模态是当下核心战场,图生视频则是技术密度最高、竞争最激烈的方向之一。HiDream-O1-Video-1.0 以双榜高位完成全球首次亮相,标志着中国优秀大模型企业已全面领先,形成全球 AI 视频模型第一梯队。

意图理解与物理规律,让画面有真实逻辑

智象未来 CTO 姚霆表示:“HiDream-O1-Video-1.0 是智象原生全模态世界模型矩阵的关键组成部分。我们始终相信,视频生成的代际进化不仅仅是像素的提升和时长的延续,而在于模型是否真正理解创作者的意图和真实世界的物理规律。HD-V1 从架构设计之初便面向文本、视频与音频的统一表征,原生全模态技术使之从‘看得清、动得顺’,迈向‘听得懂、说得准、演得连贯’。这次在两项国际权威榜单中再次进入第一梯队,是对智象原生全模态技术路线最直接的验证。”

视频生成的难点,往往不在“会不会画”,而在“有没有听懂”。用户输入常常口语化、碎片化、模糊化。HiDream-O1-Video-1.0 前置多模态意图理解模块,借助多模态理解模型的深度理解与思考,对视频内容进行结构化规划。规划内容包括镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、景别构图、运镜焦段、台词与背景声等音效设计。该模块保证模型充分理解用户自然语言输入的意图,并转换成模型可接受的专业表达。理解越深,规划越稳,后续联合生成越不容易“跑偏”。

HiDream-O1-Video-1.0 的另一重要突破,是“更懂物理”。物体在重力作用下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续,这些物理规律既被理解,也被写进视频模型的叙事之中,成为画面生成的底层逻辑。当物理规律进入生成逻辑,画面的真实质感得到全面提升。

三组 demo 在同样提示词下,由三款业内顶级模型生成视频对比,第三个 demo 为 HiDream-O1-Video-1.0 生成(全文均同)。针线画面中,HiDream-O1-Video-1.0 呈现双手相向发力时红线自然隆起,左手拇指向外轻捻线头,红线随手的发力顺势延展,张力、走向与形变贴合真实物理。画面还有极佳真实质感,指甲纹理、针的金属感等表现真实,甚至能感受到线的柔韧。

让内容决定节奏在连贯叙事中交付真实质感画面

针对高保真画质、叙事连贯性与人物一致性等关键指标,HiDream-O1-Video-1.0 实现全面优化升级。它不只追求单帧画面的精美,更要让视频内容在整体叙事维度上自治。人物、情绪、动机、物理规律一旦进入连续镜头,就必然互相影响。智象提出“先规划、后联合生成、再以多模态 Reward 对齐”的技术思路,让模型先在全局层面规划叙事与角色状态,再在联合生成中约束画面、动作和语义,并借助多模态奖励信号对齐画质、连贯性与物理合理性。

多数视频生成时长遵循固定提示词路线,比如用户在提示词中输入生成 5 秒,模型只能在这个时间窗口内填充内容,内容叙事“被迫”适应时长。HiDream-O1-Video-1.0 把时长决策交还给内容本身。模型根据事件展开逻辑、动作完成周期、叙事推进节奏,自行规划生成时长。这一能力的关键,不在简单改变帧数,而在把时长选择与内容情境绑定,服务用户真正目标,在连贯叙事中交付合理、真实质感的完整画面。苹果 demo 中,HiDream-O1-Video-1.0 生成的人物抛出、接住、稳定手持,节奏自然发生。

音画原生一体,贴近真实因果

音画不同步是 AI 视频生成模型的一个普遍通病。这是因为当前多数视频模型采用后期拼接技术路线:先逐帧生成画面,再回头配音配效,声音跟画面很难保持一致。HiDream-O1-Video-1.0 采用原生全模态架构,对文本、视频、音频信号进行联合建模。三者在同一生成过程中相互约束、相互对齐:画面运动牵引声音节奏,台词与音效反哺镜头情绪,文本条件贯穿始终。这种联合建模直接服务于音画同步与叙事连贯。镜头切换时,环境声与配乐随之过渡,人物开口时,口型、气口与情绪同频,物理动作发生时,拟音效果与撞击反馈更贴近真实因果。

乒乓球在桌子上弹跳的画面中,HiDream-O1-Video-1.0 生成的内容不仅乒乓球掉落节奏符合物理规律,每次掉落的声音也随高度变化而变化,符合现实质感。实现真实世界质感,根源在于模型技术产品哲学:以人的感受为尺度。为此在后训练阶段,采用 Diffusion Reinforcement Learning,并设计与人工认知对齐的多模态 Reward 模型,对音视频内容进行从画面到声音、从局部到整体的统一评估。

世界模型闭环成型,四大模型同源演进

从今年 4 月正式发布原生全模态世界模型架构 HiDream-O1 以来,智象陆续发布基于同一架构的模型家族,并在各自赛道取得国际权威榜单领先位置。

图像生成模型 HiDream-O1-Image 系列,其中商用版 1.5 版本在国际独立评测平台 Artificial Analysis 文生图榜单中,取得中国第一、全球第二的成绩,开源版本也取得第二的成绩。交互式世界模型 HiDream-O1-World,名列行业首个交互式世界模型基准WBench 综合总榜第一。具身世界模型 HiDream-O1-Embodied,先后在 RoboColiseum 的扰动适应和空间推理子榜单中登顶榜首。随着HiDream-O1-Video-1.0 正式发布,业内首个原生全模态世界模型闭环就此成型,图像、视频、3D 交互与具身动作在统一原生的模型中交汇、共生、循环。

智象未来创始人、CEO梅涛表示:“基于我们对下一代人工智能技术路线的认知,智象致力于构建‘一个原生全模态底座、四大模型同源演进’的模型矩阵。我们所构建的,不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化走向可落地的原生全模态体系。”

在 HiDream-O1-Video-1.0 发布之际,智象同时宣布完成 C+轮融资。本轮投资方为新微资本、交子资本、工银资本,体现了资本市场对智象未来原生全模态技术路线、世界模型布局以及产业化潜力的高度认可。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐