从40000小时视频中学会“玩”:NitroGen如何用视觉-动作基础模型打通游戏与机器人的边界

一、具身智能的“数据饥荒”

过去十年,计算机视觉和自然语言处理领域发生了一场深刻的范式变革。ImageNet、Common Crawl、LAION——这些互联网规模的数据集让模型学会了“看懂图片”和“理解语言”。但在具身智能领域,类似的事情一直没有发生。

原因很简单:缺乏大规模、多样化、带动作标签的数据。

要让一个智能体学会在物理世界中行动,你需要知道“看到什么”和“做什么”之间的对应关系。这种数据在互联网上并不天然存在——你可以找到数十亿张带标注的图片,但很难找到数百万小时的“视频+动作”配对数据。

这个问题严重制约了具身智能的发展。传统的强化学习方法虽然能在特定游戏中达到超人水平,但这些智能体极其狭窄,每个游戏都需要专门的模拟器和昂贵的训练过程,训练出来的策略几乎无法迁移到其他游戏。基于像素观察的行为克隆方法尝试直接从人类演示中学习,但它们通常依赖昂贵的演示数据收集,只能覆盖少数几个游戏。

与此同时,基于大语言模型的方法要么依赖手工编写的游戏API来获取内部状态,要么需要构建复杂的感知模块来提取文本信息和检测物体。这些方法虽然能解决复杂任务,但需要大量领域特定的设计和调优。

具身智能的“数据饥荒”,成了通往通用智能体道路上一道难以逾越的坎。

二、NitroGen的核心洞察:互联网上已经存在答案

2026年6月,一篇在CVPR 2026上入围最佳论文决选(仅15篇入围)的论文给出了一个大胆的答案。

来自NVIDIA、斯坦福大学、加州理工学院、芝加哥大学和德克萨斯大学奥斯汀分校的研究团队联合提出了NitroGen,一个在超过1000款游戏、总计40000小时游戏视频上训练的视觉-动作基础模型。

NitroGen的核心洞察极其简洁:YouTube上每天都有成千上万的玩家在直播游戏,他们的操作被记录在屏幕上,而互联网就是最大的“免费标注工厂” 。

研究团队做的事情,不是去收集新数据,而是去利用已经存在的数据。他们从公开的游戏视频中自动提取玩家的操作信息——许多游戏视频中,玩家会在画面上叠加控制器输入的实时显示(overlay),研究团队开发了一套自动解析方法,从这些overlay中提取出“什么时候按了什么键”的标签信息。

这个思路的精妙之处在于:它把互联网变成了一个巨大的具身智能数据源。不需要专门的模拟器,不需要手工标注,不需要领域特定的API——只需要公开的视频,以及一套能够从视频中自动提取动作的算法。

三、数据构建:从视频到动作标签的自动化管线

NitroGen的数据集构建是整个工作的基石。研究团队面对的是一个看似不可能的任务:从71,000小时的原始视频中,自动提取出每帧对应的手柄操作。

3.1 统一动作空间:21维向量的设计

在深入数据管线之前,需要先理解NitroGen的统一动作空间设计。这是整个系统实现跨游戏泛化的前提。

3.2 三阶段动作提取管线

从原始视频到动作标签,研究团队设计了一套精密的三阶段管线。

第一阶段:手柄overlay定位。 对于每个视频,团队采样约25帧,通过模板匹配(SIFT/XFeat)将手柄overlay与约300个模板进行比对,自动定位手柄区域。这一步的关键挑战在于:不同创作者的overlay风格各异——位置、透明度、大小、皮肤都不同。团队为此收集了438种不同的控制器皮肤。

第二阶段:SegFormer动作解析。 定位到手柄区域后,团队使用基于SegFormer的分割模型解析两个连续帧,输出11×11的摇杆网格和按钮状态。摇杆中心通过平均摇杆居中的位置来估计。分割模型处理的是两个连续帧,这意味着它能利用时间一致性来提高解析精度。

第三阶段:合成数据增强与质量过滤。 为了让解析模型在真实视频的噪声条件下表现稳定,研究团队使用Open Joystick Display、Input Overlay、GamePad Viewer和Mini Padder等工具生成了合成手柄overlay数据,并通过叠加透明度、大小、压缩等方式进行增强。关键是,合成数据中的摇杆运动遵循平滑轨迹而非随机跳跃,这使得多帧分割模型能在接近真实游戏视频的序列上训练。

最后,质量过滤器只保留至少一半时间步显示非零动作的片段。从最初的71,000小时中,55%的数据被保留,最终形成了40,000小时的高质量数据集。

3.3 动作标签的质量指标

这套自动化管线的精度是可量化的:摇杆位置的平均R²达到0.84,按钮状态的平均逐帧准确率达到0.96。

这个精度水平意味着什么?R²=0.84意味着摇杆位置预测与真实值之间的相关性很强,模型能够准确捕捉摇杆的连续位移。0.96的按钮准确率则意味着在绝大多数帧中,模型都能正确识别哪些按钮被按下。考虑到原始数据来自互联网上风格各异的overlay视频,这个精度水平是相当可观的。

数据集覆盖超过1000款独特游戏,来自818位内容创作者,每款游戏的采集时长均超过一小时,其中15款游戏的数据积累超过1000小时。从游戏类型分布来看,动作RPG占比最高,占总时长的34.9%;其次是平台跳跃类,占18.4%;其余包括动作冒险、体育、类银河战士恶魔城、肉鸽和吃鸡类等。

四、技术架构:当机器人模型学会玩游戏

4.1 从GR00T N1.5到NitroGen:架构迁移

NitroGen的架构选择非常值得玩味。它没有从零设计一个游戏AI模型,而是直接使用了NVIDIA为人形机器人设计的GR00T N1.5基础模型架构。

GR00T N1.5的原始架构是一个双系统VLA模型,包含冻结的Eagle-2.5视觉语言模型和流匹配DiT,支持视觉、语言和本体感知(proprioception)三种输入模态。其动作通过流匹配Transformer建模,在训练时输入动作通过干净动作向量与高斯噪声向量之间的随机插值进行加噪,推理时则从高斯噪声出发,迭代重建连续动作。

NitroGen对GR00T N1.5做了关键修改:移除了语言和状态编码器,只保留单一视觉-动作头。这意味着模型完全聚焦于“从像素到动作”的映射——不看文字指令,不依赖游戏内部状态,只看屏幕上的画面,然后输出手柄操作。

这个修改背后的逻辑是清晰的:游戏操作的本质是纯视觉驱动的反应式控制。玩家看到画面,做出反应,不需要语言指令来告诉模型“现在要攻击”或“现在要跳跃”。实验也验证了这一点——即使模型可以以多帧为条件,使用超过一帧过去帧也没有带来好处,因为动作游戏的初始状态已经提供了足够的上下文来引发适当的行为。

4.2 视觉编码:SigLIP 2与Token化

NitroGen的视觉输入是256×256分辨率的RGB帧。每帧通过SigLIP 2视觉Transformer编码,产生256个图像令牌(image tokens)。

SigLIP 2是Google在2025年发布的视觉-语言预训练模型,相比原始SigLIP在多语言、密集特征和分辨率适应性上都有显著提升。选择SigLIP 2而非CLIP或DINOv2,很可能是因为它的tokenizer在视觉-语言对齐任务上表现更好,而NitroGen的架构虽然移除了语言编码器,但仍然继承了GR00T N1.5预训练阶段学到的视觉-语言对齐能力。

256个token的序列长度对于Transformer来说是相当紧凑的,这保证了推理速度。但同时也意味着每个token需要承载较多的视觉信息——模型必须在有限的计算预算内做出快速决策。

4.3 流匹配动作生成:从噪声到动作的连续变换

NitroGen的核心动作生成机制是条件流匹配。

传统的行为克隆方法通常把动作预测当作分类或回归问题——给定当前画面,输出“应该按哪个键”。但这种方法有一个根本性的问题:它假设动作是离散的、独立的。而真实的游戏操作(尤其是手柄操作)是连续的、多键组合的、有时序依赖的。

流匹配的思路截然不同。它学习一个从简单分布(高斯噪声)到目标分布(真实动作)的连续变换。

从数学上理解流匹配:给定一个真实的动作块 (a \in \mathbb{R}^{16 \times 24}),一个观测 (o \in \mathbb{R}^{256 \times 256}),以及一个流匹配时间步 (t \in [0,1]) 和高斯噪声 (\epsilon),系统构造一个“带噪动作” (a_t = (1-t)\cdot \epsilon + t \cdot a)。当 (t=0) 时,(a_t) 是纯噪声;当 (t=1) 时,(a_t) 就是真实动作。

模型需要学习的是条件速度场 (u^{\text{cond}} = a - \epsilon),也就是说,它要预测“从噪声指向真实动作的方向”。训练目标就是最小化模型预测速度场与真实速度场之间的均方误差。

这个设计的直觉是:如果你知道如何从任何中间状态“指向”最终的正确动作,你就能从纯噪声出发,一步步地迭代逼近真实动作。

4.4 DiT块与交叉注意力:让动作“看到”画面

动作生成的具体实现基于扩散Transformer。

噪声动作块首先通过MLP编码为每个时间步一个动作令牌。这些动作令牌随后通过若干个DiT块进行处理,每个DiT块由交替的自注意力和交叉注意力层组成。

这里的关键设计是交叉注意力:动作令牌通过交叉注意力条件化于编码后的帧令牌。换句话说,每一层DiT块中,动作表示都会“询问”视觉表示——“当前画面里有什么信息是与我正在生成的动作相关的?”交叉注意力机制将动作生成与视觉上下文紧密绑定在一起。

自注意力层则负责动作块内部的时序一致性。16个动作令牌在时间维度上相互关注,确保生成的动作序列在时间上平滑、连贯,而不是每一步都独立生成导致动作抖动。

最终,动作令牌通过沿时间维度独立应用的MLP解码为连续动作向量。输出是一个21×16的矩阵——16个时间步,每一步21维动作向量。

4.5 推理:16步去噪生成16个动作

推理过程遵循相应的去噪过程。从纯高斯噪声 (a_0 \sim \mathcal{N}(0, \mathcal{I})) 出发,使用欧拉积分进行k步迭代去噪。每一步的更新规则是:(a_{t+1/k} = a_t + \frac{1}{k} \pi_\theta(a_t, \psi_\phi(o), t))。

研究团队发现,k=16步去噪已经足够——更多的步骤不会带来可测量的改进。也就是说,模型用16步迭代从噪声中“雕刻”出16个动作,这16个动作构成一个动作块,在游戏环境中按序执行。

4.6 模型规模:5亿参数的“系统1”反应模型

NitroGen当前的模型是一个500M参数(约4.93×10^8)的DiT,只能看到最后一帧。

研究团队将其定位为“fast-reacting system-1 sensory model”——一个快速反应的感觉模型。这个定位意味着NitroGen专注于低延迟的视觉-动作映射,而不是像GPT系列那样的深度推理和规划。这也解释了为什么它只使用单帧上下文:对于需要快速反应的游戏操作,当前帧的信息已经足够触发正确的动作,额外的历史帧只会增加推理延迟而不带来明显收益。

但研究团队也坦诚地指出了当前架构的局限性:模型目前不具备长时程规划、端到端玩通游戏、自我改进或完全零样本玩未见过的游戏的能力。这些是未来工作的方向。

五、训练策略与推理部署

5.1 训练:AdamW + EMA + 预热-稳定-衰减

NitroGen使用标准的条件流匹配目标进行端到端训练,训练配置包括AdamW优化器、预热-稳定-衰减学习率调度,以及权重的指数移动平均。训练数据是全部经过质量过滤的40,000小时视频-动作对。

在训练过程中,流匹配时间步 (t) 从一个偏移的Beta分布中采样,优先采样较小的时间步。这个设计的直觉是:在 (t) 接近0时,输入是几乎纯噪声,模型需要学习从最困难的状态出发进行预测;优先训练这些“最困难”的情况,有助于模型在整个去噪过程中都保持稳定的预测能力。

5.2 同步推理与物理引擎验证

NitroGen使用Gymnasium API进行推理,在模型预测下一个动作时冻结游戏画面。但这种“暂停-恢复”模式可能对游戏物理引擎产生未知影响——频繁的暂停和恢复可能导致物理模拟出现异常,影响评估的准确性。

为了验证这一方法的正确性,研究团队做了一组对照实验:记录人类玩家在几款游戏中的操作视频和真实动作(每段5分钟,选择预期确定性的游戏部分),然后从相同初始位置回放相同的动作——(a) 不暂停地实时回放,(b) 以随机暂停时长高频暂停-恢复地回放。

实验结果是:回放序列在连续动作游戏中约1分钟后开始出现视觉偏差,在仅离散动作的游戏中约3分钟后开始偏差。而关键发现是,两种模式下偏差出现的时间和方式完全相同——这证实了暂停-恢复并不会改变游戏的物理行为,偏差仅仅来自误差累积。

5.3 多游戏评估基准

NitroGen配备了一套系统的多游戏评估基准,涵盖10款游戏、30个任务。10款游戏包括5款2D游戏和5款3D游戏,每款测试不同的技能组合。

2D游戏包括三款横向卷轴游戏和两款具有程序生成关卡的俯视角Roguelike游戏。3D游戏包括两款开放世界游戏、两款侧重于战斗的动作RPG和一款体育游戏。

30个任务分布在三个类别中:11个战斗任务(Boss战、敌人遭遇)、10个导航任务(到达特定位置、穿越环境)和9个游戏特定任务(个别游戏特有的独特机制)。每个任务都有明确定义的起始和目标状态,尝试通常持续几分钟,成功率通过人工评估来衡量。

六、实验结果:52%的提升意味着什么?

NitroGen最令人印象深刻的实验数据是:在未见过的游戏上,它的任务成功率比从零开始训练的模型相对提高了52%。

这个数据需要放在语境中理解。研究团队在完整的训练数据集上预训练NitroGen(排除某个held-out游戏),然后在该held-out游戏上微调,与直接从零训练的模型进行对比。结果是:在数据充足的情况下,平均任务完成率提升约10%;在低数据量场景下(仅30小时游戏数据),提升幅度达到52%。

这意味着什么?如果你是一个游戏开发者或研究者,想为一个新游戏训练一个AI玩家,你有两条路:一是从零开始收集大量数据、训练一个专用模型;二是用NitroGen作为起点,只用30小时的数据微调。后者的成功率是前者的1.52倍——在完全没有见过这个游戏的情况下。

NitroGen在各种领域都表现出强大的能力,包括3D动作游戏中的战斗遭遇、2D平台游戏中的高精度控制,以及程序生成世界中的探索。研究团队在测试中确认,NitroGen成功玩转了“角色扮演、平台跳跃、大逃杀、竞速等各类游戏,无论是2D还是3D品类”。在零样本评估中,模型在多个任务上表现出45%至60%的成功率。

七、从游戏到机器人:一条意想不到的桥梁

NitroGen最令人着迷的地方,不是它能玩多少游戏,而是它的架构选择揭示了一个更深层的可能性:游戏和机器人控制之间的鸿沟,可能比我们想象的要小得多。

NitroGen的底层架构是GR00T N1.5,这一架构最初是为机器人技术设计的。而它在游戏领域的成功应用,有望反哺机器人技术,为在复杂多变且难以预测的环境中作业的机器人带来极大助益。

这个反馈循环的逻辑是清晰的:游戏提供了一个视觉丰富、交互密集、任务多样的训练环境,且数据获取成本远低于真实机器人数据。在游戏中训练出来的视觉-动作映射能力,可以迁移回物理世界——因为无论游戏还是机器人控制,本质都是“从感知到行动”的映射问题。

研究团队在实验中发现,GR00T N1.5模型在几乎不用大改结构的前提下,就能在玩法机制差异巨大的游戏任务中展现出相当惊人的适配能力。通过统一的具身智能框架,有机会在现实机器人和复杂视频游戏之间打通一条跨领域迁移的技术路径。

NitroGen的开发目标并非专注于提升游戏场景中的AI表现力,而是致力于探索一种更具通用性的具身智能训练方法。其核心理念是在大规模虚拟模拟环境中,训练智能体掌握跨越不同物理规则的通用运动控制能力。

当然,NVIDIA AI总监Jim Fan也坦言,这仅仅是个开始,还有很长的路要走。NitroGen第一个版本的研发重心明确放在快速动作控制上,Jim Fan将其称之为“玩家直觉”。未来的版本可能会加入更复杂的推理和规划能力。

八、一个更大的信号:开放与协作

NitroGen的另一个重要特征是完全开源。研究团队发布了预训练模型权重、完整动作数据集、训练与推理代码,以及一份技术细节充分的白皮书。数据集采用CC BY-NC 4.0许可证,代码和模型采用NVIDIA Source Code License-NC。

这意味着,任何对游戏AI或具身智能感兴趣的研究者,都可以直接使用这套工具来开展自己的研究。他们可以在NitroGen的基础上微调、改进,或者完全重新训练——数据集是开放的,评估环境是标准的,模型架构是透明的。

从更宏观的视角看,NitroGen代表着具身智能领域一种新的研究范式:利用互联网上已有的、非结构化的、多样化的视频数据,通过自动标注和大规模训练,来构建通用的视觉-动作基础模型。

这与大语言模型从互联网文本中学习语言的逻辑如出一辙。区别在于,NitroGen学到的不是语言,而是行动。

九、结语:当“行动版GPT”的曙光初现

回到开头的问题:具身智能的“数据饥荒”能被解决吗?

NitroGen给出的答案是:互联网上已经有足够的数据,关键在于如何利用它。

40000小时的游戏视频,1000多款游戏,818位内容创作者——这些数字本身并不惊人。真正惊人的是,一个统一的视觉-动作模型能够从中学会跨越不同游戏类型、不同物理规则的通用控制能力,并且这种能力可以零样本迁移到从未见过的新游戏中。

这让我们看到了一条通向通用具身智能的可能路径:不是为每个任务单独设计模型,而是构建一个足够大的、多样的、带动作标签的数据集,然后训练一个足够通用的视觉-动作基础模型。

NitroGen是这个方向上的一个里程碑。它证明了“行动版GPT”是可行的。而从游戏到机器人的迁移路径,则为具身智能的实际应用打开了新的想象空间——也许在不久的将来,机器人的控制能力会像今天的大语言模型一样,从互联网数据中获得前所未有的通用性。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐