游戏引擎是假的,真机器人反而学得更好?Agent 拿「假物理」当裁判,D4RL 分数涨 48%

Hugging Face 每日论文(2026-08-28 精选)

游戏里的碰撞、重力、地面摩擦都是假的。它们不是真实世界的物理,而是游戏引擎用近似公式在每一帧算出来的简化模拟,谁撞了墙、谁落地、谁滚出赛道,全是数字在替物理打工。可就是这么一套「假物理」,被一群研究者搬来当训练信号,结果机器人策略的世界模型分数涨了接近一半。这事听着反直觉,但它真实地发生在一篇刚登上 Hugging Face 每日论文榜的工作里。

8 月 28 日的这篇 arXiv 论文(编号 2608.25518)来自新加坡国立大学 HPC-AI Lab、加州大学伯克利分校与香港科技大学等机构。研究者提出一套新的后训练范式,名字叫 RLHEV,全称是「带人与引擎双重验证的强化学习」;配套的还有一个会自己动手改场景的 Agent 世界模型,叫 AWoMo。整篇论文的核心立场用一句话概括:世界模型别再靠爬海量视频加一个模糊的 AI 打分器凑合了,游戏引擎就是那个随时可以执行、可以验证、可以给奖励的天然训练场。

图:Unity 游戏引擎,RLHEV 用它的可执行场景作为世界模型训练信号

先补一个背景概念。所谓世界模型,指的是让 AI 在内部建立一个关于环境如何运作的模型:看到一帧画面,能预测下一帧会发生什么;给一个动作,能推断场景怎么响应。它是机器人、自动驾驶、游戏 NPC、生成式视频这些方向共同的地基。世界模型越准,模型在真实世界里动手之前,就能先在脑子里把后果想清楚。所以怎么训练世界模型,几乎等于怎么训练整个空间智能的底座。

为什么世界模型训练卡在「奖励」上

要理解 RLHEV 的价值,得先看世界模型训练现在卡在哪。过去几年,给世界模型(能预测下一帧画面、能理解物理规律的多模态模型)做大做强的主流做法,是收集更多真实世界的视频,用更大的算力去训练。听起来没毛病,但研究者指出这条路越来越不划算:数据是多了,可模型到底学得好不好,始终缺一个可靠的反馈信号。

代码 Agent 的成功正好说明问题在哪。代码之所以能被强化学习反复打磨,是因为代码是可执行的:编译器、测试用例、运行环境随时能告诉模型这段代码对还是错,这个反馈密集、低成本、还高度可靠。有了这样的验证信号,模型才能在训练中不断自我改进,能力不只在写代码上变强,连带推理和规划也跟着受益。

但空间智能这一侧没有这个福气。你想让模型生成一个合理的室内场景、一条能走通的路,拿什么来验证?目前主流做法是用 CLIP 之类的打分器,看生成结果和文字描述有多像。这种信号又模糊又带偏:像不像不等于能不能用,一张画得好看但实际走不通的房间图,CLIP 会给高分,真放进机器人里一步都走不了。研究者把这种局面概括为「奖励荒」:空间任务缺的不是数据,而是像编译器给代码那样可靠的可执行验证。

图:物理引擎里的碰撞测试墙,引擎能逐帧验证物体间的接触与受力

游戏引擎凭什么能当裁判

游戏引擎恰好填补了这个空缺。研究者指出,游戏场景本身就是一种「可执行的世界规格说明书」:引擎能高效地检查碰撞有没有穿模、物理合不合理、路径可不可导航、关卡能不能玩通。这些检查既密集又确定,等价于给代码跑一轮编译器。

更重要的是,开发者在游戏开发流程里还提供了一层「人的验证」:一个场景就算物理全对,开发者仍然可以判定它不好玩、不达标、要返工。研究者把这层叫隐式的人类接受度反馈。于是两条信号就凑齐了:引擎负责密度,人负责方向。

RLHEV 这个名字拆开看就是这个意思:Reinforcement Learning with Human-Engine Verification,强化学习加人与引擎的双重验证。它把这两条信号揉进同一个训练目标里,让模型既听引擎的硬检查,也顺带学开发者判断好坏的标准。

配套的 AWoMo 则把「数据工厂」本身变成 Agent。它扮演一个世界构建智能体,自己提出对场景的编辑建议,比如把一堵墙挪个位置、把障碍物调大一点,然后观察人和引擎的验证结果,把被接受或者被修复的多模态轨迹攒成新的训练数据。这样一来,数据不是被动爬来的,而是 Agent 主动生产出来的,并且每一份都带着验证后的标签。

整个流程可以拆成四步循环,方便复现。第一步,AWoMo 拿到一个基础场景,提出一处具体的编辑建议,改动必须落在引擎能检查的范围内,比如物体位置、尺寸、物理属性。第二步,游戏引擎对新场景跑一遍确定性检查,碰撞、物理、可导航性全部过一遍,把每一项的通过与否变成信号。第三步,开发者或自动代理看一眼改动后的场景,给出接受或拒绝的判定,这是人类的全局验收。第四步,被接受或被修复的轨迹整理成训练样本,喂回世界模型,模型更新后再回来提出下一轮编辑。数据就在这个闭环里持续自我生成,而不是依赖外部爬取。

图:游戏关卡布局图,游戏开发流程提供了可验证的长程轨迹数据

实测:200 个场景拿最高分,换引擎也能用

论文的实验分三块,每块都指向「可执行验证」这条路确实走得通。

第一块是 UnitySceneBench,一个包含 200 个 Unity 资产编辑任务的评测集,RLHEV 拿到最高分。这里的任务不是生成一张好看的图,而是编辑出一个真正可用的场景,靠的是人与引擎双重验证一路纠出来的能力,而不是画面好看。

第二块是跨引擎泛化。研究者把在 Unity 上训练得到的信号迁移到 Unreal 和 Godot 两个不同的引擎上,结果方向为正。这说明模型学到的不只是某个引擎的接口操作,而是更通用的「什么场景才算能用的」的判断能力。

第三块最值得 AI 爱好者关注:用 AWoMo 增强后的数据去训练下游的机器人策略,多项具身基准全面受益。室内导航任务 R2R 的成功率提升 0.79 个百分点;Gymnasium MuJoCo 上的轨迹收益提升 9.96%;D4RL MuJoCo 上的归一化分数提升了 48.43%。其中 D4RL 是具身强化学习圈最常拿来跑对照实验的基准,一次涨接近一半,是很有分量的信号。

图:机械臂操作,世界模型训练出的策略最终作用于真实机器人任务

对比维度 爬视频加 CLIP 模糊打分 RLHEV 加引擎可执行验证
验证信号 CLIP 相似度打分,模糊有偏 碰撞、物理、可导航性等硬检查
反馈密度 稀疏,一段视频一个整体分数 密集,逐帧逐物体可查
人的参与 基本不参与 隐式接受度反馈参与判定
数据来源 被动爬取网络视频 Agent 主动生产并带验证标签
对下游策略 帮助有限 R2R 加 0.79%、MuJoCo 收益加 9.96%、D4RL 加 48.43%

对普通读者来说,这篇论文的落地启示有三条。第一条,评估一份训练数据,先问有没有可验证的信号,如果一份数据只有「感觉像」的标签而没有「能不能用」的硬检查,它的上限就摆在那。第二条,当手里的基准分数推不动时,与其加数据量,不如回头找有没有能被确定性验证的任务信号,游戏、仿真、模拟器都是现成的验证源。第三条,强化学习并不一定需要精心设计的奖励函数,能把黑盒打分器接进来,就已经具备迭代条件,这对实验室和小团队都是好消息。

局限与意义

论文自己也没把话说满。第一,游戏引擎的验证再可靠,也覆盖不了真实世界的全部物理,引擎里验证过的场景不代表真实部署一定成立,跨引擎为正不等于跨现实成立。第二,AWoMo 主动生产数据的质量,仍然依赖初始奖励信号和人类反馈的标注成本,并没有从根上消除对人工的参与。第三,把世界模型、机器人策略、场景编辑串成一条流水线,工程复杂度不低,复现门槛偏高。

但意义也清楚:这篇工作把「代码 Agent 为什么行」的答案,系统性地搬到了空间智能这边。当大家都在卷更大的视频数据集、更贵的算力时,它提醒行业,数据规模之外还有一条被忽视的杠杆,那就是给模型一个能执行、能验证、能打分的训练环境。对做具身智能、做世界模型、做生成式 AI 的人来说,这是一份值得放进对照实验清单的新路线:训练信号的质量,可能比训练数据的数量更能决定上限。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐