26年7月来自Sunday Robotics的博客文章“ACT-2 Preview: Generalizing Reliability:The final step towards fully autonomous home robot deployment“:https://www.sunday.ai/blog/act-2-preview 。


1903年,莱特兄弟的首次飞行持续了12秒。这证明了动力飞行是可能的,而这比飞行变得安全普及早了几十年。机器人领域也正在经历着类似的“首次飞行”:通过演示展示新的功能,拓展该领域的想象空间。但随着这些功能的成熟,该领域也必须衡量可靠性:即性能在环境变化下的保持能力。

ACT-2,这是一个通过将广泛的泛化能力与高性能相结合来实现可靠性的机器人模型。其核心优势在于,能够利用内部迭代循环进行爬山式性能训练,并将性能提升推广到未知的环境中。这得益于,单个微调样本即可教会预训练模型一种新的、可泛化的行为。这一突破重新定义了机器人技术的扩展方程式:只需少量内部数据即可推动在现实世界长尾范围内的性能提升。最终,在各种未知的环境中,ACT-2在折叠衣物任务上实现了99.1%的零样本成功率。

ACT-2 以2025 年 11 月推出的 ACT-1 为基础(“ACT-1:基于零机器人数据训练的机器人基础模型”,https://www.sunday.ai/blog/no-robot-data,2025),在一个全栈系统中独立地展示了长时域移动操作、对未知家居环境的泛化能力以及高级灵巧性。ACT-1 拓展了机器人基础模型的功能边界。ACT-2 更进一步:验证这些能力在环境变化时能否保持可靠。

1 ACT-2 的可靠性泛化方法

ACT-2 的核心突破在于,基于内部 Memos 数据快速迭代训练所获得的可靠性提升,能够泛化到未知的真实家居环境中。关键在于通过强大的基础模型来弥合泛化能力的差距。ACT-2 使用高质量、高多样性的传感器化人类数据集进行预训练,该数据集由 Sunday 专有的数据采集硬件、数据管理系统和数据处理流程收集。

这打破了机器人学习领域长期存在的难题。使用多样化的数据进行训练可以提升模型的泛化能力,但其行为未必可靠。虽然经过筛选的窄数据集可以产生性能优异的策略,但这些优势往往仅限于数据采集的特定环境。ACT-2 将两者结合起来:随着预训练规模的扩大,模型能够利用多样化的数据进行训练,从而提高后训练的样本效率和泛化能力。

本文通过三个方面来展示该方法的优势。首先,衡量扩展预训练规模如何缩小领域内和领域外性能之间的泛化差距。其次,展示其优势所在:仅需一个样本即可教会模型新的、可泛化的行为。最后,阐述该机制如何实现快速循环,从而持续改进模型。由于 ACT-2 的学习效率极高,后训练过程能够在出现故障时迅速弥补可靠性差距。这些要素共同作用,使得 ACT-2 能够在各种不同的、未曾见过的家庭环境中,对折叠衣物这一任务实现 99.1% 的零样本成功率。

通过扩展预训练规模来缩小泛化差距

窄范围的后训练可以提高模型在新数据采集环境中的可靠性,但在未见过的条件下提升效果却微乎其微。这通常被称为过拟合:模型在内部环境中的可靠性得到提升,但在实际应用中的可靠性却没有提高。为了量化这种现象,将泛化差距定义为后训练后模型在领域内和领域外成功率之间的差异。

其主要发现是,扩展预训练规模可以缩小这一差距。随着预训练模型的增强,从少量内部数据中学习到的增益越来越具有可迁移性,而不再局限于数据采集的环境。

为了衡量这一点,在每个预训练规模下应用相同的后训练流程,然后在两个分布上评估生成的模型:后训练期间所代表的环境(称之为域内分布)和预留的环境、对象和配置(称之为域外分布)。

泛化差距随着预训练规模的扩大而显著缩小。随着差距缩小,室内测试结果能够可靠地预测实际使用效果。这样能够自信地在本地进行优化,并确信这些成果在尚未实际应用的家庭环境中也能保持。
请添加图片描述

规模本身并不足够。预训练数据的质量和组成也会影响模型的改进效率。在数据量和计算资源相同的情况下,更高质量的数据能够降低验证损失,并提高后续测试的成功率。验证损失和成功率之间存在很强的相关性,这提供了一个实用的指标,以便在进行耗时的物理评估之前改进数据混合。

请添加图片描述

从单个示例中学习可迁移行为

随着泛化差距的缩小,每个训练后的示例都发挥着更大的作用。其证明端到端模型能够从单次演示中学习新的行为,并将这些行为泛化到未见过的环境中。

语言模型表明,扩展预训练规模可以显著减少后续的适应时间:GPT-1 仍然需要针对特定​​任务进行微调,而 GPT-3 仅凭提示和少量示例即可完成许多任务。机器人领域也开始呈现出同样的趋势:π0 表明,广泛的预训练可以通过微调支持新技能的快速习得;而 GEN-0 和 GEN-1 则表明,扩展物理预训练规模可以减少所需的特定任务机器人数据,GEN-1 报告的任务完成时间约为一小时。“GPT-1”(2018);“GPT-3”(2020);“π0”(2024);“GEN-0”(2025);以及“GEN-1”(2026)。
请添加图片描述

用简单的监督式微调 (SFT) 对同一个预训练模型的四个独立副本进行后训练。每个副本都接收一次不同折叠技巧的演示。然后,在未见过的、预先准备好的衣物上评估每个检查点。所有四个模型都成功执行了它们新学习的技巧。

通过后训练提升可靠性

预训练使 ACT-2 具备在未知环境中进行泛化的能力,但一次性演示不足以弥补这一不足。部署级可靠性和性能的差距主要来自棘手的极端情况和故障,这些情况只有在策略在真实环境中反复运行后才会出现。模型之所以能够从单次演示中学习新行为,正是因为其具备这种泛化能力,同时也能够从恢复过程中高效学习。后训练循环正是为了弥补这些差距。由于其拥有机器人、模型、集群基础设施和数据操作的端到端控制权,因此整个改进循环可以快速完成。

请添加图片描述

2 家用机器人:通用智能的试金石

家用机器人具有独一无二的特性:研究与市场契合。家用机器人之所以实用,其所具备的那些要求也指向了通用智能。家庭是一个充满无限变化、长尾效应和持续变化的空间。因此,家用机器人的功能范围不能过于狭窄。为了创造真正的价值,它必须在无需特殊设置的情况下,在各种开放式的变化中可靠地运行,而这正是对具身通用智能的实际检验。市场对研究要求的正是这样的智能:能够泛化、改进并在群体中累积的智能。

以折叠衣物作为检验这一命题的起点。这既是一项日常家居功能,也是更广泛挑战的一个集中体现:成功需要机器人处理物体及其初始状态的巨大差异。衣物会变形、相互遮挡、结构差异很大,而且很少以相同的状态出现两次。这种实用价值与操作复杂性的结合,使得折叠衣物成为一项极具挑战性的首要任务,而其背后的原理也旨在应用于远不止于此的领域。

根据一个名为 Solve 的标准来评估 ACT-2:在规定的范围内,以既定的适配成本实现可靠的性能。
请添加图片描述

这些边界界定ACT-2结果背后的论断。99.1%的成功率反映在所声明的分布范围内,使用相同的模型检查点且无需针对每个家庭进行任何调整时的性能。这是一个针对实际家庭操控能力所报告的最大范围、最低调整成本的结果,也是证明长尾效应可以通过通用、可扩展的方案来解决。

请添加图片描述

。。。。。。待续。。。。。。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐