在这里插入图片描述

📖标题:HappyWorld-Bench
🌐来源:arXiv, 2609.24308v1

🛎️文章简介
🔸研究问题:现有的世界模型往往只注重生成画面的视觉质量,但它们在智能体进行探索、交互和修改时,能否保持状态一致性和响应准确性?
🔸主要贡献:论文提出了HappyWorld-Bench基准,通过统一的六层能力框架,系统评估视频、空间和具身三类世界模型在交互下的可靠性。

📝重点思路
🔸构建W1-W6层级能力框架:从基础的感知构建(W1)、交互式模拟(W2)、持久性记忆(W3),到可编程干预(W4)、可扩展共享(W5)及通用世界建模(W6),定义了衡量世界模型可靠性的标准。
🔸设立三大独立评估赛道:涵盖视频世界模型(测试时空连贯性)、空间世界模型(测试物理可用性与编辑一致性)和具身世界模型(测试机器人视角下的动作响应与状态保持)。
🔸结合人工与自动评估:建立HappyWorld-Arena平台进行人类A/B对比以获取Elo评分,同时开发针对行为正确性的自动化指标,全面捕捉主观偏好与客观缺陷。

🔎分析总结
🔸视频模型存在长程一致性漏洞:虽然头部模型如HappyOyster和Genie 3在视觉质量上表现优异,但在长时间 rollout 和场景重访时,物体身份和几何结构容易漂移,且对规则修改的响应不够精准。
🔸空间模型物理可用性不足:现有系统在物理放置准确率上最高仅达70.14%,编辑执行率约73.33%,许多模型生成的场景虽美观但缺乏有效的导航网格或物理支撑面。
🔸具身模型难以维持多步状态:在复杂的多步动作序列中,模型常出现初始状态未建立、中间状态丢失或最终目标未达成的情况;且对物理规则(如重力、摩擦力)改变的敏感度极低,几乎无法体现动力学变化。

💡个人观点
论文关注“世界真不真”,指出当前技术最大的痛点不是生成能力,而是交互后的状态保持和因果逻辑。

在这里插入图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐