26年8月来自Perception AI公司的论文“Isaac 0.5: Percepts Scale Control”。

Isaac 0.5 是一个拥有 360 亿个参数的开放权重具身基础模型,它将视频感知、具身视觉推理和机器人控制统一到一个稀疏骨干网络中。所有输出都来自同一个共享表示:该模型通过一个基于骨干网络状态的专用 Flow 专家,输出语言和接地输出、离散的 FAST 动作token以及连续动作。还引入了空专家(null expert)路由,它允许每个token根据需要使用模型 256 个路由专家中的 0 到 8 个。

Isaac 0.5 的独特之处在于其协同训练的规模和组成。远程操作提供直接的控制监督,但每个可接受的小时数都需要占用一个机器人、一个操作员和特定任务的基础设施。视频成本更低、数据更丰富,但缺乏机器人动作和本体感觉。为了从视频中学习,Isaac 0.5 使用一种专有的自监督视频目标函数,该函数根据先前的帧预测未来观测的语义内容。其将预测的与任务相关的可见状态和变化称为感知。其目标由视频自动构建,无需人工标注或动作标签;目标构建和损失函数的实现仍为专有技术。

Isaac 0.5 联合训练未来感知预测、视频感知、具身视觉推理和控制。视频和自回归动作监督更新共享表征,而连续动作则训练一个基于其状态的 Flow 专家。这是一个将通用无动作视频扩展到一百万小时,并同时包含以自我为中心的视频、手持机械臂 (UMI) 视频和机器人数据的研究。

在通用视频、以自我为中心的视频和 UMI 视频的固定比例为 80:30:30 的情况下,将通用视频从 1000 小时增加到一百万小时,使得经过良好校准的离线动作损失阈值对应的网格内远程操作交叉点从 5884 小时减少到 28 小时,减少了 210.3 倍。相邻的测量远程操作阶梯将此比率限制在 83 到 300 倍之间。当与更多远程操作数据结合使用时,额外的视频可以更有效地减少动作损失。其发布了超过 35 个训练实例的权重、推理和自适应代码、评估设置以及机器人特定的部署配置。


Isaac 0.5 是一个基于单个 36B 参数稀疏骨干网络的开放权重具身基础模型。该模型直接从其隐状态发出语言、接地和 FAST token化的离散动作,并通过专用的 Flow 专家和基于相同状态的扩散Transformer (DiT) 发出连续动作。感知、具身推理和控制都通过该共享表示进行训练,而不是通过悬挂在冻结编码器上的策略,因此从视觉数据中学习到的结构可以传递到控制输出。

核心问题是,低成本、无动作的视频是否可以减少对远程操作机器人数据的依赖。通用视频广泛地采样视觉世界,但通常不包含显式的机器人动作、本体感觉或动态信息。其可作为主要尺度轴,与以自我为中心的视频、手持机械臂(UMI)视频和机器人数据一起进行测试,并将视频时长扩展到一百万小时。

其用专有的自监督目标函数从视频中学习,该目标函数可以根据先前的帧预测未来观测的语义内容。该文将预测的与任务相关的可见状态或变化称为感知:例如,物体已被抓取、抽屉已打开或即将发生接触。该术语描述的是目标函数的预测内容,而不是其目标函数的构建方式。目标函数来自未来的视频观测,无需人工标注或动作标签;它们的构建和损失函数的实现方式均为专有信息。通用视频在视频混合中占比最大,因为这些感知出现在机器人数据之外。由于每个接口都读取共享的表示,因此从视频中学习的结构可供动作接口使用。

本文将通用视频:以自我为中心的视频:UMI 视频的组成比例保持在 80:30:30,并针对远程操作对所有三个视频流进行缩放。在主要的离线操作损失阈值下,将一般视频时长从 1000 小时增加到 100 万小时,网格内遥操作交叉点从 5884 小时减少到 28 小时,增幅达 210.3 倍。相邻的遥操作测量阶梯将此比率限制在 83 倍到 300 倍之间。这种变化是有条件的,而非均匀的:经验损失与视频时长的关系曲线在 1 小时遥操作时几乎保持平缓,并且从大约 100 小时遥操作时长开始,每增加 10 倍视频时长,损失值稳定在 -0.21 左右。


数据方案必须解决两个不同的覆盖问题。第一个是视觉覆盖:模型必须识别物体、几何形状、接触情况、状态变化以及任务进展,而这些场景远比机器人周围能够重现的场景要多得多。第二个是操作覆盖:它必须将这些观察结果与通过特定控制界面表达的动作联系起来。没有任何单一数据源能够大规模地提供这两种覆盖。通用视频覆盖范围广,但缺乏动作信息。以用户为中心的录像将摄像头靠近手部并记录接触情况,而 UMI 式手持夹爪则无需部署机器人即可添加设备运动和时间信息(Grauman,2022;Chi,2024)。机器人轨迹提供了最强的动作基础,但它们与特定实体绑定,且采集成本高昂。

因此,将这些数据源视为互补的监督信息,而不是可以互换的示例。广泛的视觉数据可以教会重复出现的状态和变化;以交互为中心的视频缩小了观察事件和理解事件展开过程之间的差距;机器人数据提供了控制所需的状态和动作界面。共享的表示和类型化训练路径使得这些数据源能够协同训练,而无需假设缺失的动作字段就是否定动作标签。通过改变链接的通用、以自我为中心的和 UMI 视频混合与远程操作之间的关系,分离出此方案中的一个可控权衡。

1 混合组成和暴露

混合包含 529 个数据源流。直接绘制的数据被分为两个顶层组件:感知和具身推理,以及面向机器人的数据。感知组件涵盖通用视频、视觉问答、空间定位、文档、字幕和其他指令数据。机器人组件涵盖高质量远程操作、更广泛的机器人交互以及交互式或模拟体验。这种划分是一种统计边界,并非声称感知和控制在模型中是分离的。这两个组件都会更新共享训练系统。

这种区别在本方案中至关重要。感知和具身推理获得 69.7% 的直接调度器权重,而机器人技术获得 30.3%。机器人技术示例在每次抽取时会扩展到更多密集位置,因此经审计的暴露量逆转表面上的平衡:79.6% 的密集tokens来自机器人技术组件,而 20.4% 来自感知和具身推理。因此,仅报告采样器权重会低估优化器实际输入中以动作为中心的部分;仅报告密集暴露量会掩盖产生它的调度器策略。

在数据混合发现过程中使用 SkillRater(Sahi,2026)。它针对特定能力的评分器会针对不同的目标技能筛选数据,而不是将所有样本压缩成一个全局质量分数。这对于需要不同形式能力的混合数据集至关重要:一个有用的基础示例不必与一个有用的时间推理示例相似,而且它们与机器人轨迹的选择依据也不同。SkillRater 有助于识别这些能力的候选数据。图 1 中的数值并非由图 1 中的数值设定;图中所示的质量是最终的调度器配置,而非评分者得分。
请添加图片描述

图 1 按模态和主要监督类型划分相同的直接调度器质量。由于一个数据流可以承载多个任务标签,因此如果统计每个标签,则会导致混合数据重复计算。改为按以下顺序为每个数据流分配一次:机器人组件成员;视频模态;指向;问答或计数;OCR 或结构化提取;字幕;以及其他指令数据。非视频感知类别在剩余的调度器质量中保持其相对权重。

由此得出的视图比之前的双组件划分更为具体。视频理解在 135 个流中占调度器资源总量的 30.0%,与分配给 56 个机器人和控制流的 30.3% 几乎持平。视觉问答和推理是第二大类别,在 199 个流中占 23.7%。指向和空间定位在 76 个流中占 7.0%;OCR 和结构化文档在 32 个流中占 6.7%;字幕和描述在 20 个流中占 1.9%;其余 11 个指令流占 0.3%。这些统计数据表明,资源总量和目录广度都非常重要。机器人技术集中在少数几个资源量较大的流中,而问答和定位则将其资源分散到更广泛的资源库中。

每个类别都支持具身界面的不同部分。视频提供时间上下文和可见的状态变化。问答和推理则将语言与当前呈现的内容和正在发生的事情联系起来。指向训练明确地输出空间信息,而文档和OCR数据则保留了对嵌入视觉世界中的文本的理解能力。机器人技术将观察结果与具身状态和动作联系起来。这些角色在具体案例中相互重叠,因此图表采用的是明确的优先级规则,而不是将这些类别呈现为彼此独立的科学概念。

表1在这些百分比后面添加了原始尺度。感知和具身推理组件包含3T个原始tokens。机器人技术组件包含100,000小时的源数据,涵盖35种以上的具身配置:10,000小时的高质量演示、40,000小时的更广泛的机器人轨迹,以及50,000小时的游戏和模拟数据。
请添加图片描述

2 自我中心标注

自我中心视频在观察世界和指挥机器人之间找到了一个有用的中间地带。从机器人控制的角度来看,录像仍然不涉及动作,但第一人称视角使得手部动作、接触以及局部任务进展比一般视频更加清晰易懂。将这些视觉证据转化为三个嵌套层级的结构化监督信息。录像提供了完整的任务上下文。积极的活动片段标识了任务进展可见的时间段。在这些时间段内,帧级实例使用方框和解剖关键点定位左右手,而时间对齐的标签则描述了每只手的可见动作、操作对象、可见性、接触情况以及标注置信度。

这种层级结构至关重要,因为操作标签并非自然地对应每一帧。一个任务可能持续数秒,两只手可能在同一时刻扮演不同的角色,一只手即使短暂静止也可能仍然发挥重要作用。保留了每个支持字段的源时间戳和原始像素坐标,从而保持任务进展、手部几何形状以及手与对象的交互与底层视频保持一致。积极的活动片段表明在该时间段内发生了可见的进展。它不会将所有未受支持的手势区域或区间外的每一帧都视为否定动作示例。当视觉证据不足时,该区域将被省略。

用自主研发的 Perceptron Mk1 模型生成这些标注。之所以选择它用于生产标注流程,是因为与评估过的 Gemini 配置相比,其测量成本和吞吐量更适合此规模。这是构建数据流的操作性选择,而非对训练好的 Isaac 0.5 检查点的评估结果。图 2 展示了生成的标签如何保留双手任务的不对称性。
请添加图片描述

在第 8 秒,双手都接触到了煎蛋,但它们的角色不同:左手将煎蛋放到三明治上,右手则引导并按住煎蛋的边缘。在第 20 秒,双手都被标记为“放置”,但它们的描述仍然区分了拿起和摆放三明治与将三明治切片分开。如果将任何一帧合并为一个动作标签,就会丢失这种分工。每只手的记录既保持了这种分工的可见性,又与共享的任务片段和源时间保持关联。

3 空闲-跨度过滤

源小时数只有在与训练信号保持关联时才有用。在处理的开源机器人数据集中,记录的轨迹可能包含长时间的等待、仅摄像头运动或重复帧。直接计算这些时间段会夸大时间覆盖范围,并将解码、打包和优化器的容量浪费在几乎没有额外任务监督上。

仅对具有已验证空闲信号的机器人源压缩持续的空闲运行。该规则会移除足够长的空闲间隔的内部,同时保留短暂的停顿及其周围的转换边界。未验证信号的源数据将保持不变。并不将视觉上的静止状态等同于空闲状态:即使末端执行器移动幅度很小,保持的姿态、机械稳定状态或接触丰富的运动仍然可能提供有效信息。因此,验证过程涵盖了这些情况,并且是针对每个源进行验证,而不是通过一个全局运动阈值。

最后,数据记录将记录的机器人运行时间与优化器消耗的机器人运行时间分开。前者描述了捕获的内容;后者描述了经过源特定压缩并用于训练的剩余数据。这使得10万小时的源数据清单可以审计,而无需声称记录的每一秒都具有相同的优化权重。

Isaac 0.5 的构建方式是,视频监督会改变生成动作的表征。语义和自回归token目标会更新共享的主干网络,而连续控制目标则基于该表征训练一个 Flow 专家。缩放性测量依赖于这种联系:如果没有共享表征,视频时长就无法替代远程操作时长。发布的检查点是在该测量中最高的视频预算(一百万通用视频时长)下训练的。

1 共享架构

Isaac 0.5 基于开源的 Qwen 系列视觉语言配方构建。语义和自回归tokens目标训练一个共享的稀疏主干网络,而专用的 Flow/DiT 路径则根据其状态生成连续动作。

视觉输入使用大小为 16 的图像块,并投影到一个由 40 个稀疏块组成的 2048 宽的主干网络中,其中 30 个块使用 GDN 线性注意机制,10 个块使用完全注意机制(Yang,2025b)。每个块包含 256 个实际路由的 MLP、一个学习到的空路由行(扩展为 256 个空副本)以及一个始终开启的共享专家。

总共 360 亿字节的数据涵盖检查点中的所有参数:视觉编码器、40 个带有注意机制的主干网络块、路由行、256 个路由的 MLP 和始终开启的共享专家,以及连续路由的 Flow 专家和 DiT。每个 token 的活动参数是指一个 token 实际执行的参数,在 50% 空参考值(即 8 条路由中有 4 条是实际路由)时为 2.5B,当空参考值在 0 到 8 之间变化时,活动参数约为 0.1B 到 3B。权重记忆是第三个量:它保存所有 256 个专家,无论 token 是否执行这些专家。而视觉编码器、注意力机制、共享专家和连续控制路径的运行与实际路由的数量无关。

2 空专家

标准的混合专家层会将每个 token 路由到固定数量的前馈专家。空专家(null-expert)会向路由添加学习到的空操作选择:当一个空专家占据前 k 个槽位时,该层会跳过相应的路由 MLP。因此,实际执行的专家数量可以因 token 而异,同时所有 256 个专家和每个 token 的最大预算仍然可用(Kilian,2026)。具身序列交错包含文本、图像、状态和动作tokens,这些tokens无需消耗相同数量的路由工作。

可变路由工作是如何产生的?路由器有 257 行学习数据:每行对应 256 位真实专家,还有一行对应空选项。对于每个token,空行产生一个分数 u_∅,该分数被复制成 256 个空副本,并与 256 位真实专家的分数连接起来。这样就得到了 512 个候选分数,用于从中选出前 8 个最佳token,并划分了每个token的预算(Kilian,2026):其中 j 为严格高于 u_∅ 的真实专家分数的数量,该模块选择

k_real = min(8, j), k_null = 8 − k_real,

忽略完全相同的并列情况,并根据索引确定性地打破这些并列。共享的空值分数是基于真实专家分数学习的阈值,因此 k_real 的值在 0 到 8 之间逐token变化,而专家库保持完整大小。当 k_real > 0 时,在丢弃空路径后,门权重会根据选定的真实路径进行重新归一化;当 k_real = 0 时,路由贡献为零。共享专家库和残差路径不受影响。

为什么是 256 个空值副本而不是 8 个?对于仅选择前 k 个路径的情况,多重性几乎无关紧要:在公式 2 中,任何数量等于或大于 8 的空值副本都会产生相同的 k_real 值,因此 8 个副本即可重现该机制。多重性的影响体现在路由分布上。在所有 512 个分数上进行 softmax 操作时,256 个相同的空值 logit 对配分函数贡献 256 eu_∅,相当于一个空值分数,其 logit 为 u_∅ + log 256。因此,多重性决定了空路径的初始概率质量,并在不添加参数的情况下改变路由器梯度和负载均衡统计信息。

3 共享动作接口

自回归路由使用相同的隐状态来表示语言、坐标、接地、具身推理以及一个不相交的 2048 tokens FAST 动作词汇表(Pertsch ,2025)。连续路由将主干状态从 2048 维投影到 768 维,作为 36 块 DiT 的交叉注意力键和值(Peebles & Xie,2022;Fang,2026)。 DiT 将该上下文与带噪声的动作块和流时间相结合,然后预测用于恢复连续动作速度(Lipman,2023;Black,2024)。训练过程中,每个动作块抽取 S = 4 个独立的噪声和流-时间样本;图 3 展示两种路径:一种是带有空专家路由器的共享稀疏块,另一种是交叉关注主干上下文的连续控制 DiT。

请添加图片描述
请添加图片描述

发布的检查点基于来自 35 种以上机器人界面配置的数据进行训练——其中 31 种是真实的机器人硬件或硬件系列,其余包括模拟设置、采集装置、游戏手柄布局以及一个聚合的多平台数据集——每种配置都包含特定于机器人的观察、动作、归一化、计时和安全配置。图 4 显示同一个检查点在 YAM 和 SO-101 上执行相同的请求的杯子堆叠操作,只需更改配置提示中的实例字符串即可。
请添加图片描述

4 自监督的未来-感知预测

用“未来-感知预测”来指代一种专有的自监督视频目标。给定观察历史,它预测从未来观察中提取的语义信息,而不是重建未来的像素。该目标不需要人工标注或动作标签。其将预测的与任务相关的可见状态或变化称为感知。这可能是物体状态、空间关系、可供性、任务阶段、可见接触变化,或近期可能的任务状态。该术语描述了预测目标,但没有说明该目标是如何构建的。

5 离散与连续控制

连续特征归一化。每个策略-状态数据集、归一化范围和目标都有其自身的动作和本体感觉统计数据。如果稀疏二值或接触通道的两个分位数重合,但其观测的最小值和最大值不同,则这些极值将取代该维度的折叠边界。例如,当机械臂在数据集的几乎所有帧中都处于闭合状态,但在少数帧中打开时,就会发生这种情况。

6 联合训练目标

完整的训练目标包含三个监督部分、一个 LM softmax 正则化器和两个路由辅助部分。令 Ω 为打包批次中符合条件的自回归目标位置。它包括感知和推理响应、坐标和控制token以及 FAST 动作tokens;提示位置和填充位置被排除在外。
其中流项由动作块独立归一化。将监督目标与稀疏路由正则化器相结合,即可得到用于反向传播的标量。

7 类型化多模态训练

源数据集存在不兼容的假设。视频有帧时间但没有机器人状态;指向示例有坐标但没有动作;远程操作轨迹包含摄像头、本体感觉和特定于身体的控制信息。连续的动作块也无法安全地扁平化为文本序列。多模态和谐(mHarmony)在打包之前解决这些差异:其强类型编译器验证源模式,降低特定于身体的坐标和状态,对齐时钟,并发出 TensorStream 事件(Perceptron Team,2026)。

每个事件都携带其模态、时间戳、来源以及相关的坐标或身体帧。图 5 展示从异构源到单个打包序列的路径。文本、图像和视频块、空间目标、机器人状态以及FAST动作被打包成一个包含16,384个token的序列。连续流目标在token流之外保持键值(KV),并共享相同的观测标识符,而因果动作历史记录则以类型化历史记录的形式输入。
请添加图片描述

类型化使得不同的数据源能够共享相同的表示形式,而不会抹去控制所需的区别。在打包之前,系统会根据每个机器人模式解释每个状态向量,保留坐标系,保持因果顺序,并选择正确的归一化方式。同一合约涵盖所有35个以上的已发布机器人接口。
降低(lowering)将机器人事件转变为一个因果训练样本。动作锚点 t⋆ 是目标动作块开始的步骤;观察结果和通过 t⋆ 完成的历史记录是输入上下文。然后,编译器根据数据集来源和轨迹元数据解析机器人配置,并渲染包含机器人系列、目标形式、控制速率、相对动作语义、动作布局和可用摄像机视图的配置块。

该算法针对每个降低的训练窗口独立地对三个二元条件掩码进行采样。图 6 显示这些抽取的操作:值为 1 时,会在模型可见的前缀中保留相应的可选组件;值为 0 时,会省略该组件,而不会改变观测值、策略状态或目标操作。
请添加图片描述

错误标志用于描述事件,对场景历史记录没有影响。如果一个可用的场景或子任务事件以动作锚点结束,则可以进入用户端历史记录;后续事件则保持隐藏状态,只有当目标被启用时才会成为助手端预测。在服务阶段,任何非零的训练支持都会使可用的动作历史记录具有确定性,并将错误值默认设置为 false,从而使训练和推理具有相同的认证前缀格式。图 7 总结降低(lowering)的路径及其在训练和服务过程中所保留的契约。

请添加图片描述

8. 与具体实现无关的事件

前面以机器人事件的形式阐述降低(lowering)的契约,但其中没有任何内容是专门针对机器人的。事件是一个按因果顺序排列的观察流,包含时钟、每个决策点的锚定动作以及结果。远程操作提供这种形式的事件。录制的会话也提供这种形式的事件,其中智能体操作图形界面,屏幕即为观察对象,结果为会话是否满足既定任务。

Isaac 0.5 使用相同的事件对象表示两者,并通过同一次降低过程处理两者。动作接口是唯一的区别点。物理实现会在声明的坐标系和动作布局中发出连续的目标;数字实现会发出离散的命名调用,其参数会根据声明的接口进行检查。两者都不是从数据中推断出来的;编译器会拒绝无法与声明接口匹配的数字动作,就像它会拒绝宽度与其布局不符的物理动作一样。

这两个情况共享的不仅仅是一个容器。当数字动作引用屏幕上的某个位置时,该位置使用模型应用于指向和检测的相同标准化坐标表示,而不是原始像素或特定于界面的元素标识符。对于模型来说,点击目标和检测目标是同一类型的对象,通过相同的输出路径生成。这就是感知训练达到控制的渠道。

有界观察环境

对于机器人事件,模型以一到三个观察为条件。我们从概率为 2 的泊松分布中对计数进行采样,并截断为以下区间。

因果动作历史

因果动作历史指的是在当前预测目标之前执行的、序列化的动作。这为模型提供一个闭环自校准信号:在生成新动作之前,模型可以交叉检查最近的命令与它们之后的观测结果,估计执行偏差,并在下一次预测中进行补偿。同样的比较方法也可以在熟悉的物理实例的新上下文中校准模型,包括执行器响应、延迟和控制缩放方面的差异,而无需更新其权重。

图 8 显示了每个锚点可见的动作行。编译器会为每个打包窗口绘制一次 C_FAST,这与观察计数和场景丢弃绘制是分开的。来自先前动作的 FAST tokens作为输入上下文进入,不会损失动作tokens,并且与 FAST 目标保持区分。在回合开始时,填充不会创建动作历史。由于时间间隔在 j 处停止,因此当前和未来的动作无法进入上下文。目标可以携带 FAST 监督、Flow 监督或两者兼有(Pertsch,2025)。因果动作历史是一个显式的输入字段,而不是内部循环状态。

请添加图片描述

9 训练方案详情

优化

用 AdamW 训练集(Loshchilov & Hutter,2019),参数设置为 β1 = 0.9,β2 = 0.95,ε = 10⁻⁶,权重衰减为 0。基础学习率为 10⁻⁵,视觉参数和 Flow 专家模型的学习率均为 5 × 10⁻⁶。经过 200 步预热后,所有学习率均采用余弦衰减至峰值的 10%。将全局梯度范数截断在 1.0。
图 9 测试联合训练方案在不同尺度和归一化规则下的数值鲁棒性。在分析的 10 万步运行中(使用了 500 步预热),全局损失、全离散损失、FAST 损失、Flow 损失、路由器 z-loss 损失和 CCE z-loss 损失曲线均呈下降趋势,而负载均衡损失曲线则始终保持在 8.0 附近。这些轨迹共同提供了运行级别的证据,证明在 100,000 步内联合优化算法具有鲁棒性。
请添加图片描述

基于延迟的实时分块

训练过程中加入了实时分块 (RTC),使得新的连续动作块可以从推理返回时已执行的命令继续执行(Black,2025a;b)。

令 H ≥ 2 为动作块时域,d 为已承诺前缀长度,D = min(12, H − 1) 为最大模拟延迟。令 p ∈ [0, 1] 为非零延迟的概率,λ > 0 为泊松速率。d 以概率 1 − p 取值为 0;否则,d 服从截断为 1, …, D 的泊松分布。

。。。。。。待续。。。。。。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐