26年8月来自Perception AI公司的论文“Isaac 0.5: Percepts Scale Control”。

Isaac 0.5 是一个拥有 360 亿个参数的开放权重具身基础模型,它将视频感知、具身视觉推理和机器人控制统一到一个稀疏骨干网络中。所有输出都来自同一个共享表示:该模型通过一个基于骨干网络状态的专用 Flow 专家,输出语言和接地输出、离散的 FAST 动作token以及连续动作。还引入了空专家(null expert)路由,它允许每个token根据需要使用模型 256 个路由专家中的 0 到 8 个。

Isaac 0.5 的独特之处在于其协同训练的规模和组成。远程操作提供直接的控制监督,但每个可接受的小时数都需要占用一个机器人、一个操作员和特定任务的基础设施。视频成本更低、数据更丰富,但缺乏机器人动作和本体感觉。为了从视频中学习,Isaac 0.5 使用一种专有的自监督视频目标函数,该函数根据先前的帧预测未来观测的语义内容。其将预测的与任务相关的可见状态和变化称为感知。其目标由视频自动构建,无需人工标注或动作标签;目标构建和损失函数的实现仍为专有技术。

Isaac 0.5 联合训练未来感知预测、视频感知、具身视觉推理和控制。视频和自回归动作监督更新共享表征,而连续动作则训练一个基于其状态的 Flow 专家。这是一个将通用无动作视频扩展到一百万小时,并同时包含以自我为中心的视频、手持机械臂 (UMI) 视频和机器人数据的研究。

在通用视频、以自我为中心的视频和 UMI 视频的固定比例为 80:30:30 的情况下,将通用视频从 1000 小时增加到一百万小时,使得经过良好校准的离线动作损失阈值对应的网格内远程操作交叉点从 5884 小时减少到 28 小时,减少了 210.3 倍。相邻的测量远程操作阶梯将此比率限制在 83 到 300 倍之间。当与更多远程操作数据结合使用时,额外的视频可以更有效地减少动作损失。其发布了超过 35 个训练实例的权重、推理和自适应代码、评估设置以及机器人特定的部署配置。

。。。。。。继续。。。。。。


在描述了模型及其训练数据之后,现在来评估视频协同训练的价值。探究视频协同训练对达到校准良好的离线动作损失阈值所需的远程操作的影响程度。该评估采用双因素网格:七个通用视频预算(从 1,000 小时到 100 万小时不等),与基于 2,000 小时到 10,000 小时通用支持范围的远程操作预算交叉,每个单元格运行一次,并嵌套视频子集。任务和实现方式均采用第 3 节中固定的评估设置,而非进行更改。网格中的每次运行均使用前面的架构和目标,并且已发布的 Isaac 0.5 检查点是网格中最高的视频预算点,因此以下评估描述的是发布的方案,而不是一项单独的研究。

1 训练数据类型

用四种类型的训练数据,语料库组成和过滤在之前进行了描述。通用视频展示了外观、运动和语义变化,但不包含产生这些变化的动作。以自我为中心的视频提供了第一人称视角的手部动作、接触情况和任务进度(Grauman 等,2022),包括手部姿态数据,可提供近似的人类手部运动。通用操作接口(UMI)式手持夹爪无需机器人即可记录夹爪的运动和时间,但仅限于设备可执行的动作(Chi,2024)。特定任务的远程操作成本最高,它直接记录机器人指令、机器人状态、时间和结果。

网格图显示通用视频与远程操作的对比。每个视频预算都包含被动式以自我为中心的视频流和 UMI 辅助视频流,每个视频流在标记为 V 的点贡献 3V/8 小时;称之为链接视频混合,因为这三个视频流的规模是同步的。远程操作的成本独立变化。前面分析采用远程操作:通用视频:以自我为中心的视频流:UMI = 1:10:3.75:3.75 的比例。该组合保持了测得的 80:30:30 视频比例,并为每个远程操作小时分配 10 小时的通用视频。网格提供损失响应;前面将其与价格相结合,以获得成本觉察的混合。

2 测量设计

设 V 为 80:30:30 混合比例下的通用视频小时数,h 为可接受的特定任务远程操作小时数,L(V,h) 为离线动作损失,数值越低越好。V 和 h 的单位均为小时。L 是一个在固定设置下评估的单一保留动作目标,并且在网格的每个单元格中保持不变,因此网格内的损失具有可比性;τ 以该目标的单位表示。比较仅依赖于这种不变性,而不依赖于目标的选择。

在每个固定的视频预算 V 下分别构建一个单调包络:在每个远程操作阶梯上,用在该阶梯或任何更低小时数阶梯上观察到的最低损失。阈值穿越采用以 log10 小时为单位的线性插值,图 10A 则在常见的 2 至 10,000 小时遥操作支持范围内,以 log10 电压为单位应用相同的插值。因此,每个穿越点和表面值都位于测量网格内。此外,对于每个至少由五个视频预算表示的遥操作阶梯,对原始损耗进行以 log10 电压为自变量的回归。图 10B 中的这些阶梯斜率描述了观测到的网格。该网格每个单元格包含一次运行,且视频子集是嵌套的,因此不给斜​​率附加标准误差,也不将其解读为因果效应。

图 10C 显示一个有界配方对比:七次非感知运行,每次运行对应一个视频预算,训练时没有采用语义未来-感知目标。
请添加图片描述

图 14 所示的物理国际象棋系统在一个循环中完成棋盘感知、走法选择和实际执行。
请添加图片描述

图 13 明确地展示这种编排方式:具身推理和 VLA 控制是同一个 Isaac 0.5 检查点的两种路由模式,而不是单独部署的高级模型和低级模型。在每个回合开始时,Isaac 0.5 从机器人的摄像头视图读取棋盘并重建当前位置。走法选择随后以两种预设模式之一运行。在闭环模式下,模型从其学习的国际象棋知识中选择走法。在工具辅助模式下,Isaac 0.5 通过其工具接口调用 Stockfish 并执行返回的走法。两种模式都终止于相同的类型边界:一个精确的从源到目标的命令,例如将兵从 e2 移动到 e4。
请添加图片描述

选定的命令与当前的摄像头观测值和机器人状态一起,不加任何转述地传递给 VLA 控制请求。控制路径将场景中指定的方块和棋子接地,生成动作块,并执行拾取和放置动作。随后,新的观测结果开始下一回合。这种划分方式明确了策略边界:启用后,Stockfish 会选择一个移动,但从不向机器人发出指令;而 VLA 则始终接收精确的移动指令并执行其物理实现。在对 500 条人工采集的轨迹进行训练后,所有尝试的基线策略均未能成功完成一次试验,成功率均为 0%。注:前面图 14 记录了最终的完整部署过程。

衡量开放权重策略从一次迭代中获取特定任务控制并将其更新迁移到附近场景的难易程度。以固定机器人、棋盘、摄像头布置和动作界面的物理国际象棋操作任务为例来构建基准测试。国际象棋场景提供了一个可控的演进过程,从重复的运动行为到指令控制的抓取和放置,再到多步执行,同时保持物体和工作空间在不同层级间的可识别性。前面图 14 展示共享的工作空间和同步的摄像头视图。

该基准测试包含三个层级。在固定移动层级,棋盘被重置,机器人反复抓取同一枚棋子并执行相同的从源到目标的移动;这隔离了抓取和运动适应能力。在符号控制层级,指令以国际象棋坐标表示法指定任意的源和目标,例如 e2-e4,机器人必须识别并移动相应的棋子。在进攻路线层级,机器人执行一条预设的进攻开局路线,以及由先前移动选择的一组数量庞大但有限的分支变招。最后一个测试阶段旨在检验单回合适应性能否迁移到相关的多步序列中。它并不要求实现不受限制的国际象棋对弈或独立策略选择:系统会提供棋路和合法分支,评估的行为是它们的物理执行。

每个阶段收集两个完整的专家回合,分别记为 eA 和 eB。这对回合保留了机器人和动作的语义,同时引入了可控的偏移:对于固定走法,棋子姿态或执行路径发生扰动;对于任意的拾取放置,棋子或棋盘状态的记谱法有所不同;或者在同一进攻路线中引入不同的变化。评估两个方向:首先在 eA 上进行微调,然后在 eB 上进行测试;之后恢复已释放的检查点,在 eB 上进行微调,然后在 eA 上进行测试。本次比较包括 π0.5、SmolVLA、MolmoAct2、GR00T N1.7 和 Isaac 0.5(Black,2025c;SmolVLA,2025;Fang,2026;NVIDIA,2026c)。

训练实现。对每个检查点在其原生训练栈中进行微调,而不是在一个框架中重新实现每个模型。Isaac 0.5 使用与其预训练和发布微调相同的内部训练代码库和动作接口。对于 π0.5,用 Physical Intelligence 的官方 OpenPI 训练流程(Physical Intelligence,2025);对于 SmolVLA,用官方的 Hugging Face LeRobot 实现(SmolVLA 团队,2025);对于 MolmoAct2,用已发布的 Allen Institute 训练库及其固定的 LeRobot 集成(Fang,2026)。对于 GR00T N1.7,用 NVIDIA 官方的 Isaac-GR00T 微调流程(NVIDIA,2026c)。每次运行都固定代码版本、基准检查点标识符、软件环境、可训练参数集、优化器和学习率。

一个共享transformer将相同的 10 Hz 国际象棋回合数据以各框架所需的数据集模式呈现,并在加载后验证观测时间戳、动作顺序、单位和有效锚框的数量。每个原生训练器保留其已发布动作的目标函数和归一化路径,但一个 epoch 始终意味着对这些已验证的锚框进行一次遍历,不进行替换采样或重复短回合。在评估之前,预测结果会从原生模型表示解码到通用基准动作空间。主要排名使用每个版本推荐的自适应模式;仅在匹配接口敏感性分析中分别比较全参数和参数高效的结果。

原生初始配置方案有意针对特定模型:原生配置方案的比较将已发布的自适应接口视为被评估系统的一部分。保留推荐的可训练参数掩码、优化器族、峰值学习率、权重衰减、梯度裁剪、正则化和有效批次大小,并将批次大小限制为 |Ie|,以确保每个训练阶段都不会被重复样本填充。

将观测值、状态和动作重采样到同一个 10 Hz 的控制网格上。每个有效的控制时间点都是一个动作锚点,一个训练周期是对微调阶段中所有有效窗口进行一次随机遍历。相邻窗口重叠,因此打乱顺序会改变优化顺序,但不会使样本统计独立。每个策略都保留其原生动作目标和生成的块长度。评估使用每个块的前 Heval = 10 个未来动作行,对应于一秒;更长的块仅在评分时进行裁剪。迭代策略使用其已发布的推理设置,其中 π0.5 和 SmolVLA 使用 10 个流程步骤,MolmoAct2 使用 8 个流程步骤。所报告的是所有其他基线所使用的设置,而不是将流程步骤数等同于控制速率。


训练一个感知-控制模型依赖于稳定的有效tokens供应。普通视频长度不一,解码成本高昂。机器人轨迹虽然更短且结构化程度更高,但其收集成本使得优化器在空闲跨度上花费的步骤显得尤为浪费。稀疏层进一步加剧了不平衡,因为不同类型的tokens需要的路由工作量不同。从源头解决每个问题:训练前进行类型化编译,在输入管道中进行预测流式传输和独立解码,在编码前进行视觉平衡,在模型内部进行路由平衡,以及在路由后进行压缩执行。图 16 展示了这些步骤的运行位置。此外,工作进程返回的不仅仅是一个批次:它预先计算了不依赖于前向传播的模型端张量,包括多模态旋转位置、模态和角色掩码、每个动作的流上下文掩码以及 MFU 统计所需的每个模态的标记计数。因此,训练步骤无需在前向传播和后向传播之间为这些张量付费。

请添加图片描述

1 mHarmony

mHarmony 是用于模型输入的强类型编译器。 mHarmony扩展OpenAI的开源Harmony渲染器和解析器,而非引入另一种数据格式(OpenAI,2025)。mHarmony将视频、文本、图像、状态、任务描述和动作转换为TensorStream事件,并明确包含模态、时间、坐标、具身性和损失语义(Perceptron Team,2026)。观察的动作与模型必须预测的动作保持分离,这使得共享的主干网络能够基于通用视频、以自我为中心的交互、机器人感知和动作监督轨迹进行训练,而无需将缺失的控制字段视为否定动作标签。

2 序列打包

mHarmony为每个文档发出一个事件流。排序器为文档 i 分配token长度 l_i、连续动作块数 a_i 和跳跃计数 s_i,然后将其添加到工作队列 Q 中。当队列达到其文档限制 M、包含至少一个token的上下文窗口或旧文档达到重新打包阈值 S 时,打包开始。

每次打包过程都会对队列进行快照,并按 l_i 递减的顺序对文档进行排序。超长文档会被拆分为 L 个tokens的前缀和后缀;前缀立即打包,后缀返回队列。然后,该过程会访问已排序的文档一次。部分填充的bin b 会记录其已使用的token u_b 和动作块 c_b。

过程结束后,u_b/L ≥ ρ 的bins会被发出。在一个未填充bin中的文档跳跃计数会递增,并返回队列 Q,后续到达的文档可能会填满该bin。一旦 s_i ≥ S,后续的每个到达都会触发另一次打包过程,但 S 并不会强制未填满的bin发出数据。如果bin仅仅因为动作块限制而无法容纳其他方面兼容的文档,则会被发出而不是重新排队。在输入结束时,强制打包过程会发出剩余的bins。只有在选择bin进行发出后才会添加填充。每个bin内的文档顺序保持不变,完整的文档保留其文档结束token;这些tokens定义了可变长度的因果注意力片段,因此打包后的文档不会相互关注。在完整的训练混合数据集上,该算法会保留 2% 的tokens作为填充。

打包保证。对于独立同分布 (IID) 的传入流,bin分配在语义上是条件独立的:在打包器可见的元数据条件下,它不会在剩余内容中引入任何依赖性。因此,所有偏离 IID 的情况都简化为该低维元数据的联合规律,并且可以从打包轨迹中测量出来。对于固定的多重集和匹配的随机抽取,打包和解包执行会产生相同的隐状态、掩码损失和参数梯度,包括通过空路由移除、分组专家压缩和全局路由目标。强制刷新精确地保留幸存的单文档边缘分布,但跳跃阈值和最佳匹配分配都不能保证较小的联合独立同分布距离。

3 可靠的视频输入

Rust 调度器使用每个工作节点的未来样本顺序来规划节点级共享内存中的分片下载、缓存创建和驱逐。节点一致性重标记(relabeling0在将云样本重写为节点本地块的同时保留了计划的槽(slot)结构,因此同一节点上的工作节点请求相同的分片,并且每个分片只获取一次。间隔较长的重复访问拥有各自的缓存生命周期。这样可以避免视频密集型混合数据集将远程存储延迟转化为优化器空闲时间。仅凭缓存命中率无法体现这一点,因此测量完整训练混合数据集下的端到端数据等待时间。

视频解码运行在与其数据加载器工作进程分离的独立进程中。超时、编解码器错误和致命的解码器故障(包括在 FFmpeg 中观察到的段错误)只会终止解码器子进程;监督进程会启动一个干净的子进程,工作进程会继续运行。空间变换和 TensorStream 组装不在此故障边界内。长时间的测试会统计解码片段、替换片段和未恢复的故障,并按编解码器测量延迟以及优化器等待输入所花费的时间比例。

仅对具有已验证空闲信号的机器人源压缩长时间静止跨度。源特定的阈值和最小持续时间会移除持续空闲运行的内部区域,同时保留短暂的暂停和过渡边界。验证集包括保持、稳定和接触丰富的运动,因为视觉上静止的末端执行器仍然可以携带控制信息。数据记录将记录的机器人运行时间和优化器消耗的机器人运行时间分开。

4 分布式视觉平衡

经过时间采样和补丁处理后,视觉示例包含不同数量的tokens。在每个步骤中,本地视觉平衡会根据当前每个秩的块大小重新计算一个正则化的最优传输方案。其传输成本倾向于本地 NVSwitch 域内的分配,从而限制速度较慢的跨域流量。最终方案会在编码之前将整个视觉块跨数据并行秩移动,从而在不改变示例内容的情况下减少滞后样本。全局路由器平衡在token路由之后执行,用于规范专家资源的聚合使用,并且仅在不同秩之间交换分配统计信息;token路由保持在本地。图 17 对比了这两种情况。分别测量:编码前的视觉- token不平衡,以及路由后的专家-分配分散。

请添加图片描述

5. 实现空路由的稀疏执行

空专家路由会改变执行的多层感知器(MLP),即使路由器仍然返回固定的前 8 个决策。内核将实际分配压缩成连续的前缀,并将空后缀排除在分组矩阵乘法之外,因此编译形状保持不变,而实际专家调用次数则随token变化。连续的 Flow/DiT 路径具有不同的执行图,并且单独编译。在线性注意力模块中,与 MoE 兼容的 GDN 融合将归一化与输入投影相结合,而不会改变路由器分数或专家分配(Yang,2025b)。有界融合token损失,避免为异常大的打包批次去创建词汇表大小的中间体。

观察的分配。空路由与任务和阶段密切相关(图 18所示)。提示分配在不同任务之间差异很大,而解码token始终使用几乎所有八个实际专家槽(slot)位。单独的视频评估显示相同的提示/解码划分。这些计数衡量的是路由式 MLP 调用次数,而非端到端 FLOP 或延迟。
请添加图片描述

经过三轮评审,检查 142 个候选渲染图,并选出 16 张局部对比度最清晰图(图 19所示)。在这些示例中,高度零散的上下文围绕着可识别的低零散结构,例如飞机、人物、滑雪者、几何和科学图表以及包含答案的文档区域。这些地图展示路由式计算分配:实际路径较少的区域接收到的专家 MLP 更新也较少,而其残差流表示则继续在层堆栈中传递。

请添加图片描述

在一个预先注册的 512 个样本配对干预实验中,强制解码器第 3 至 39 层中的两个顶角图像标记仅采用零路径,使任务平衡的官方得分相对于假干预降低了 0.227 个百分点,固定队列的 95% 自助法置信区间为 [-2.205, +1.742] 个百分点。结果未通过部署安全门,因此夹具未展开或部署。

7. 优化的两阶段推理

在单个加速器上以两个共置的 vLLM-Omni 阶段来提供策略。第一阶段通过骨干网执行一次多模态预填充,并返回最终归一化后的隐藏状态。第二阶段运行 0.58B DiT,基于这些状态进行条件化,应用 10 次欧拉更新,并返回一个动作块。转换携带完整的前缀激活和动作上下文可见性掩码。因此,前缀缓存是执行契约的一部分:如果没有合并的前缀,动作专家将只会收到最终的隐藏状态行,而不是观察上下文。

机器人进程拥有控制时钟、动作队列和随机数流。每个请求包含原始 uint8 相机帧、机器人单元中的本体感觉、任务提示、锚点时间戳、显式流噪声以及自上一个请求以来已执行的动作行。这些执行的行有两个用途:它们固定实时分块前缀,并提供因果动作历史记录。服务器验证有效载荷摘要,通过 mHarmony 渲染请求,规范化状态,并运行这两个阶段。它返回一个规范化的动作块,客户端将其转换为机器人单元一次。将渲染和规范化操作保留在进程边界的同一侧,使得提供的输入可以根据训练契约进行审计,并避免通过网络传输内部 TensorStream 对象。图 21 显示最终的服务路径及其在机器人控制回路中的位置。

请添加图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐