26年7月来自Sunday Robotics的博客文章“ACT-2 Preview: Generalizing Reliability:The final step towards fully autonomous home robot deployment“:​https://www.sunday.ai/blog/act-2-preview 。

。。。。。。继续。。。。。。


3 性能

请添加图片描述

所有折叠(fold)尝试均由一组标注员使用专门开发的评分工具进行评分。每次尝试均被判定为成功或失败,成功的折叠将根据以下质量标准进行评分。评分分两轮进行:一位标注员给出初始评分,另一位标注员独立复核,如有分歧则由复核负责人解决。标注员在评分开始前接受一组参考折叠的培训,评分标准在评估前已确定,评估后不再修改。

长尾成功案例

当服装能够自主折叠并堆叠时,即视为一次成功的尝试。

在涵盖9种主要服装类型的785次自主尝试中,ACT-2的总体成功率达到99.1%(标准误差±0.3%)。

按服装类型、初始配置、机器人位置和床单颜色分析性能。各类别的成功率均保持较高水平:短裤、长袖上衣(厚款和薄款)、polo衫和无袖上衣的成功率最高,达到100%,而女式衬衫的成功率最低,为94.7%。
请添加图片描述

女式衬衫更难识别,是因为其轻薄易变形的结构提供了较少的稳定几何线索,不利于抓握和对齐。这些结果并不反映用户的能力存在上限。
请添加图片描述

折叠质量

折叠是一个要求很高的操作问题。 ACT-2 必须推理可变形的布料,对齐相应的边缘,并通过重新抓取和堆叠来保留折叠。这些技术挑战最终很重要,因为它们决定了用户收到的折叠质量。因此,每一个折叠的标准是折叠是否整齐、紧凑、完整、稳定。

根据这些品质使用五星级评分标准评估每个完成的折叠。每个折叠从五颗星开始,每个缺陷类别扣除一颗星。
请添加图片描述

其用两英寸的阈值,因为超过该点的多余或未对齐的材料会在折叠处产生明显的凹凸,并使衣服更难整齐地堆叠。

在完成的778次折叠测试中,ACT-2的平均得分为4.72/5:98.3%达到四星或五星质量标准,其中73.8%获得满分。在评估的服装类型样本中,平均质量得分从Polo衫的4.63到紧身裤的4.88不等。
请添加图片描述

为了更好地理解这些评分,将ACT-2和人工折叠的衣物并排展示。在这些例子中,ACT-2折叠出的衣物在对齐度、紧密度和堆叠稳定性方面都与人工折叠的衣物相似。
请添加图片描述

速度

测量的是ACT-2从开始取回衣物到将折叠好的衣物添加到衣物堆中的完成时间,包括自主重试和恢复操作。在778次成功尝试中,ACT-2完成任务的中位数为2分13秒,平均数为2分19秒。完成时间因衣物类型而异,反映了衣物几何形状和操作复杂程度的差异。

请添加图片描述

涌现行为

ACT-2 最引人注目的特点之一是它经常带来惊喜。大规模预训练能够产生一些并非明确指令的行为,这些行为会在长尾条件下涌现:例如边缘情况恢复、抗干扰鲁棒性以及全身操控,这使得 Memo 的工作范围超越了桌面机器人的工作空间。

边缘情况恢复

真实的家居环境会产生各种混乱的中间状态:衣物掉落在地,或者被折叠起来,导致遮挡,使机器人难以解析。ACT-2 将这些状态视为可恢复的,而不是死胡同:它可以从地上捡起衣物,重新调整衣物方向,在状态改变后继续折叠,并进行涌现的精细调整,以确保高质量的折叠效果。

抗干扰鲁棒性

家居环境并非受控环境。Memo 的工作空间与人类共享,这会带来持续的变化和干扰。 ACT-2 在这些干扰下依然可靠:它可以重新规划并继续执行任务,而不是遵循固定的顺序。

超越固定桌面工作空间

折叠衣物需要很大的操作空间。婴儿服(16 英寸 × 8 英寸)、8XL 超大号衬衫(38 英寸 × 42 英寸)和大毛巾(53 英寸 × 28 英寸)不仅尺寸不同,所需的操作空间和操作策略也各不相同。这正是全栈式设计的重要性所在:ACT-2 采用通用移动平台,而非固定的桌面装置。Memo 可以重新定位、调整高度并倾斜身体,从而扩展模型的操作范围。

4 Solve:机器人技术进步的新标准

以上结果描述了ACT-2的性能。但性能本身并不能决定一项能力的意义;它必须结合其可靠性适用范围以及实现该范围所需的调整来解读。

在完全陌生的环境中,无需任何调整即可达到99.1%的成功率,这与在一件衣服、一个准备好的表面和一个熟悉的房间里测得的99.1%的成功率有着本质的区别,即使两者的百分比相同。

这就是为什么演示不足以衡量进步的原因。每个演示都受到其自身环境、物体、初始状态、准备工作和干预规则的影响。如果没有一致的方式来描述这些条件,结果就难以比较或在此基础上进行改进。

提出一个标准,明确阐述完整的性能主张。称之为Solve:在既定范围内,以既定的调整成本实现可靠的性能。

每个解决方案都包含三个组成部分:
性能:在既定范围内,该功能运行的优劣,包括成功率、质量和速度。
范围:该功能声称能够保持性能的环境、对象和配置的分布。
适应成本:每次新部署所需的额外数据、演示、微调、干预或系统修改。

解决方案共同作用,使机器人技术的进步具有可比性和累积性。一旦确定了范围和适应成本,成功率、质量和速度等指标才具有意义。只有这样,才能衡量策略的有效操作范围是否在扩大、部署要求是否在降低以及性能是否在边界内提升。

根据此标准对 ACT-2 进行了评估。评估前已明确了范围和适应成本,评分标准也已预先确定,并且评分过程也已记录在案。在此框架下,ACT-2 的结果不仅仅代表了高成功率,还表明同一模型无需针对特定部署进行调整,即可在广泛的实际应用环境中保持高可靠性。

5 迈向通用机器人

ACT-2 预览版以洗衣作为第一个解决方案,但其最终目标是提供一个方案,将有限的实验室数据转化为可广泛迁移的行为。ACT-2 并非从零开始构建每一项新功能。

同一个基础模型已经学习了一系列更广泛的家务技能,包括吸尘、玩具整理、拉拉链、翻裤子和煮咖啡。这些技能尚未经过解决方案标准的测试,但每一项都展现了共享模型的不同优势:工具使用、整理杂乱空间、精准操作和长期可靠性。

各项能力的提升可能并不均衡。通用智能并不要求所有行为都以相同的速度发展。一个能够以 60% 的可靠性完成所有任务的机器人,可能不如一个能够可靠地完成少量但有价值的任务的机器人有用。将一项有价值的能力推向部署门槛,不仅能立即创建一个有用的系统,还能为模型的改进创造一个良性循环。

每一次改进都让下一次改进变得更加容易。为洗衣任务开发的数据和方法强化了可以迁移到其他任务中的通用行为。ACT-2 提供了一个可重复的扩展方案:利用有限的内部数据进行改进,广泛推广这些成果,并在更强大的基础上构建每一项新功能。随着时间的推移,Memo 的价值将不再取决于任何单一任务,而是取决于它学习和可靠地完成家庭所需一切任务的能力。
请添加图片描述

6 将 ACT-2 应用于家庭

1914 年,在“十二秒”事件发生十一年后,第一家航空公司开通了坦帕湾航线的定期航班,每天两班。这一转变意义重大,因为它意味着飞行变得足够可靠,可以支持日常使用;而一旦实现了这一点,航空业便从一条航线扩展到了全球网络。

正如航空业从可行性验证发展到可靠服务一样,ACT-2 测试将于周日完成,届时 Memo 将从展示其功能走向在各种实际应用场景中验证其可靠性。由此,机器人技术将进入加速发展阶段。随着每一项改进在机器人群中推广,智能不断增强,每一项新功能都让后续功能的学习变得更加容易。

今年秋季,将通过 Beta 测试计划向家庭用户部署 Memo。这标志着迈向一个不久的将来:通用机器人将成为日常生活中值得信赖的一部分,它们可以应用于家庭各个角落,适应各种突发情况,并迅速扩展人们可以信赖的功能范围。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐