26年9月来自韩国庆熙大学和新加坡国立的论文“Self-Evolving AI for Humanoids: Mechanisms, Safety, and Evaluation of Post-Deployment Self-Improvement”。

这篇综述最有价值的贡献,是把人形机器人的研究目标从“训练出一个强策略”,扩展为:机器人部署后,如何持续改进,并保证每一次改动都不会破坏已有的安全能力。 它建立了较完整的研究框架,但其中不少环节仍是研究设想,尚未形成经过长期实机验证的闭环系统。

这篇文章主要讨论的是 Self-Evolution,即部署后的持续自我进化。机器人学会新技能、更新记忆、调整身体模型,都属于它讨论的对象;其范围比递归自我改进(Recursive Self-Improvement,RSI)更宽,因为RSI 还需要进一步证明:机器人能够改进“使自己进步的机制”,并让这种改进推动后续学习。

如图 1所示:从“冻结式部署”到“自我进化”。(a) 传统流程离线训练策略,将其固定(冻结),并进行长期(数月或数年)部署;然而,外部环境、任务需求及机器人本体会随时间发生变化,导致系统效能逐渐下降。(b) 具备自我进化能力的类人机器人利用部署期间的经验,通过进化过程实现自我更新。相关案例包括 TTT-Parkour [173]、DreMa [6]、LOTUS [137]、SkillsCrafter [142]、Egocentric model [48] 和 SplitAdapter [61]。
请添加图片描述

论文首先提出:人形机器人面对的不是固定任务,而是持续变化的世界和身体。(第1—3页)

传统流程是:收集数据、离线训练、部署一个冻结的模型。但机器人长期运行时,至少有四类因素不断变化:
世界变化:光照、地形、物体、布局、摩擦等发生变化。
身体变化:执行器磨损、关节间隙、传感器漂移、负载变化,以及维修或部件更换。
知识变化:任务规则、物体知识、操作流程和用户需求更新。
能力要求变化:机器人需要学习新技能、组合旧技能,并处理更长、更复杂的任务。

因此,部署时表现良好,并不意味着几年后仍然可靠。论文关注的是:机器人能否利用自身运行产生的成功经验、失败轨迹、传感器数据和人类反馈,持续维护并扩展能力。

其中最有辨识度的一点是:身体本身也会变化,而且身体既是被控制对象,又是感知世界的工具。 这让人形机器人的自我改进比纯软件智能体多了一层困难。

为了描述这种变化,作者把机器人建模为五个可更新部分。(第4—5页,式1—4、如图2所示)
请添加图片描述

s_tau = (pi_tau, Phi_tau, M_tau, W_tau, B_tau)

请添加图片描述

这里的“身体更新”需要谨慎理解:论文讨论的大量案例是更新对身体的认识和控制方式,并不意味着机器人已经能够自主制造或更换身体部件。

作者用一个进化算子 E 表示更新过程:

s_tau+1 = E(s_tau, e_tau, theta_tau)

其中,e_tau 是部署经验,theta_tau 是更新机制自身的参数。文章还写出了更慢的元更新:

theta_tau+1 = F(theta_tau, e_tau)

前一个公式描述“改进机器人”,后一个公式才开始涉及“改进改进机制”。

作者规定,自我进化应具备三个条件:由经验驱动、产生持久改变、具有自主性。临时换一个动作,并不自动构成自我进化。

整个系统分为两个时间尺度:
快速内环:执行感知、决策和控制,维持实时运行。
慢速外环:积累经验、提出修改、验证修改,再提交新版本。

可以把论文的整体结构理解为:
请添加图片描述

其优化目标是全生命周期的累计效用,同时考虑更新过快带来的验证压力,以及遗忘旧能力的代价。作者把这概括为“可塑性—稳定性”的权衡:既要学得动,也要保得住。


综述的主体把现有研究组织成四类互相连接的机制。(第5—19页)

请添加图片描述

作者按自主性逐渐增强的顺序介绍它们,但也承认这些机制在实际系统中高度交叉。

1 自学习部分的中心,是“学新东西时,知识应存在哪里、怎样更新”。(第5—9页)

论文讨论了三条路线。

第一条是持续学习,重点解决灾难性遗忘:
LEGION:通过可增长的非参数知识结构保存不同任务的经验。
LOTUS:从示范中发现技能,建立可扩展、可复用的技能库。
SkillsCrafter:冻结基础模型,用相互隔离的低秩适配模块减少技能之间的干扰。
LifeLong-RFT:改变基础策略的更新方式,用强化微调降低顺序学习带来的遗忘。

第二条是在线学习,重点解决真实交互的效率和风险:
DayDreamer 利用世界模型把真实交互扩展为大量想象轨迹,在四足机器人和机械臂上展示在线学习。
ResFiT 冻结已有策略,只学习较小的残差修正,缩小真实机器人上的探索范围。
HIL-SERL、Robot-Trains-Robot 分别利用人类或另一台机器人提供干预和辅助。
TTT-Parkour 先扫描新地形、重建仿真环境,再进行测试时训练。其项目报告,在多数测试地形上,采集、重建和训练的完整流程少于10分钟。

第三条是自监督学习:利用视频、深度、本体感觉等天然存在的数据学习表征,减少对人工标签的依赖。

这一部分最值得记住的观点是:机器人需要选择性遗忘。 旧执行器的动力学、过时的标定可能应该被替换;紧急停止、平衡恢复等能力则应该受到保护。单纯追求“永不遗忘”并不适合会磨损的机器人。

如图 3 所示:针对灾难性遗忘的三种架构方案,其区别在于累积知识的存储位置:(a) 生成式非参数化记忆 [106];(b) 包含路由元控制器的显式且持续增长的技能库 [137];© 采用改进更新规则的单一基础策略,其中利用多维过程奖励进行的“组块级”(chunk-level)强化微调,取代了易导致遗忘的监督式微调 [88]。
请添加图片描述

如图 4 所示:通过降低物理风险和增加对学习模型的依赖来排序的三个在线改进点:直接在具有受限更新 ResFiT [4] 的硬件上,在安全包络内的硬件 Robot-Trains-Robot [46] 上,以及在当前世界 TTT-Parkour 的即时重建内 [173]。 DayDreamer 的世界模型提供了关键机制,将每次真实的交互转化为许多想象的交互。

请添加图片描述

2 自适应部分强调:环境变化、身体变化和用户变化,需要不同的处理方式。(第9—12页)

对于环境变化,作者区分两种互补策略:
部署前扩大覆盖范围:通过域随机化、多仿真器训练,让策略提前见过更多情况。
部署后修正剩余差异:监测异常,再通过适配模块、残差策略或测试时训练进行调整。

这里的关键不只是“怎么调整”,还包括什么时候应该触发调整。任务失败可能来自新环境、身体异常,也可能只是偶发噪声,系统必须先判断原因。

对于身体变化,论文重点介绍身体自建模、动力学辨识和负载适应。例如,机器人可以比较自身动作与视觉反馈,推断身体模型是否失准;也可以将“物体负载变化”和“机器人自身动力学误差”分别建模。

对于用户变化,机器人可以通过偏好学习调整速度、动作方式、顺应性和接触力。有些偏好可以作为策略的条件输入,改变行为时不必重新训练整个模型。

贯穿这一部分的设计趋势是:保留已有基础策略,将修改集中在较小、可检查、可撤销的模块中。 不过,“容易撤销”与“已经证明安全”是不同的结论。

如图 5 所示针对领域、形态及个性化变迁的受限人形机器人自适应概念框架。域自适应结合了部署前的分布吸收机制 [69] 与部署期间的失配检测及在线调整机制 [133, 111]。形态自适应同样将具身泛化与自建模能力 [48, 132] 与部署后的受限修正机制 [61, 146] 相结合;而个性化机制则通过学习或显式呈现用户偏好,将其作为条件变量或明确的交互约束 [9, 70]。这些互补机制被整合为一个统一的“保护与自适应”生命周期:在该周期内,既保留经由验证的基础策略,又仅执行受限范围内的更新,同时将部署结果反馈用于后续的监控、自适应调整或再训练过程。
请添加图片描述

3 自优化部分把强化学习、世界模型、规划和自反思连接起来。(第12—16页)

这四个组件分别承担不同职责:
强化学习提供改善行为的信号,例如提高成功率、降低能耗或缩短操作时间。
世界模型预测候选动作的后果,支持想象中的训练和测试。
规划将长任务分解成技能,并在执行失败后重新组织步骤。
自反思尝试从执行记录中发现问题、解释原因并提出修正。

自反思被整理为一条四阶段链路:

发现失败 → 解释失败 → 转换成可执行修正 → 将经验用于后续学习。

例如,REFLECT 侧重解释失败,Phoenix 进一步将解释转化成动作修正;EVOLVE-VLA、TT-VLA 等研究则尝试在部署时利用进度反馈继续更新策略。

这里需要区分两个层次:当场纠错改善的是这一次任务;只有把纠错结果保存下来并改善后续行为,才形成论文所强调的持久自我改进。
随后,作者讨论“数据飞轮”:上一轮策略产生新轨迹,筛选和扩增后的轨迹训练下一轮策略,更强的策略再产生新的训练数据。DexFlywheel 是这一思路的代表。

如图 6 所示面向人形机器人安全自优化的以世界模型为中心的架构。强化学习(RL)、规划和自我反思机制生成候选策略、动作及修正更新,而世界模型则在这些内容于现实世界执行之前预测其后果 [149, 41]。预测性世界模型通过三条互补路径与自优化系统相耦合——即“预测至感知”[167]、“预测至策略优化”[171] 和 “预测至规划” [85]——从而实现预见性控制、基于想象的学习以及具备后果感知能力的规划。
请添加图片描述

如图 7所示面向人形机器人的、由自我反思驱动的自优化流程。系统通过基于进度和哨兵机制的监控 [97, 76] 在执行过程中检测或预判故障,并利用多模态执行轨迹 [90] 对故障进行解释。所得解释被转化为电机层面的修正指令 [150] 或学习信号(如稠密奖励 [73]),从而使修正后的经验能够通过部署阶段的学习 [5, 84] 改善后续行为。世界模型验证器负责评估其一致性、可行性及安全性。
请添加图片描述

4 自生成部分进一步把“学什么、用什么数据学”的主动权交给系统。(第16—19页)

文章将其整理为五类:

请添加图片描述

如图8所示从数据飞轮到自主生成阶梯。从左至右的演进过程中,所需的人工投入逐渐减少:依次为 HOMIE 的驾驶舱 [7]、DART 的云端 AR [117]、DexFlywheel 的单周期自动化数据生成 [172],以及最终的 GR00T N1 基础模型 [10]。

请添加图片描述

如图9 所示由演化算子提出的候选更新量 ∆s 必须依次通过五道关卡:限制步长的信任域、世界模型验证关卡 [55]、针对受保护的关键安全技能的单调性检查,以及与操作员意图的一致性检查;只有全部通过后,该更新才会被采纳执行。整个运行过程处于“人类安全包络”(human envelope)范围内,并以具备跌倒保护功能的 SafeFall [107] 系统作为物理底层的安全保障。

请添加图片描述


作者希望建立的闭环是:系统发现自身短板,主动生成合适的训练经验,学习后再发现新的短板。

它同时带来一个根本风险:数据、奖励、任务和评判器越来越多地由系统自己产生,外部纠错信号可能越来越弱。 因而,数据量增加不等于真实能力必然增加,更不等于安全性提高。

安全部分的核心贡献,是把审查对象从“一个动作”扩大到“一次系统更新”。(第20—21页,图9)

作者综合提出五层防护:

请添加图片描述

这里有一个容易误读的细节:人类监督边界不是排在最后的普通关卡,而是包围整个进化流程的约束。 图9还画出了通过检查后的提交步骤。

作者进一步提出,让不确定性决定可接受的更新幅度:对新身体、新环境缺乏把握时,更新应更保守;获得更多可信经验后,才允许扩大更新范围。

保护性摔倒策略被放在这些机制之下,作为失效后的减损措施。它不能证明更新安全,只能降低某些失败的物理后果。

论文明确承认:保护安全关键能力不退化的“单调性”机制,仍是尚未解决的问题。 五层结构是作者提出的综合框架,不能理解为已有完整系统已经实现了全部保障。


评测部分要求观察“进化轨迹”,而不只看训练后的某个版本。(第22—23页,式5、表5)

作者提出四个指标:

请添加图片描述

这比仅报告最终成功率更有意义。例如,两个系统最终都能达到90%的成功率,但一个需要几分钟恢复,另一个需要几天、频繁人工干预,实际价值完全不同。

论文认为,现有资源分别覆盖了部分问题:HumanoidBench 提供全身任务,LIBERO 提供持续学习任务序列,真实数据集和仿真平台提供训练及测试基础,但仍缺少同时包含以下因素的统一基准:

部署后自主更新、持续环境变化、身体变化、旧技能保持、物理安全和长期运行。

因此,文章提出了基准建设方向,尚未提供一个完成实现并经过统一评测的新基准。


将全文压缩成最值得把握的要点,可以保留以下六条:
研究对象从固定策略变成了持续更新的机器人系统。
身体漂移是具身自我改进的核心变量。
更新可以发生在记忆、技能库、工作流和适配模块中,不必总是修改大模型权重。
世界模型既支持学习,也被赋予更新前验证的职责。
应该淘汰过时知识,同时保护安全关键能力。
真正需要优化的是长期运行表现,包括学习成本、恢复过程和安全退化。

关于“领域问题”,首先是作者自己指出的领域难题(第23—24页):
理论保证不足:难以证明每次更新都会改善机器人,更难保证安全能力始终不退化。
样本效率不足:真实交互昂贵,适应速度可能赶不上环境和身体变化。
遗忘机制不成熟:尚不清楚如何可靠地区分过时知识与必须保留的知识。
验证模型会失准:身体变化会让用于验证的世界模型或仿真器逐渐不准确。
系统资源受限:学习、仿真和验证要与实时控制竞争算力、能量、内存和散热预算。
多模块更新相互影响:感知、策略、身体模型和规划单独更新有效,组合后却可能失稳。
审计与监督机制不足:需要记录改动及其后果,并建立针对持续更新过程的评估办法。


最后,这篇综述存在的问题:

  1. “自我进化”的定义与实际纳入的案例不完全一致。

第4页要求更新必须具有持久性和自主性,但后文纳入了大量离线训练、部署时冻结、仅靠条件输入或历史状态推断调整行为的方法。

一个明确例子是 SplitAdapter:综述第10页自己也说明,它在部署时通过冻结策略上的推断实现适应,并非继续学习。原始项目也将其描述为冻结基础策略、通过上下文编码器进行调制。

这些研究当然可以作为自我进化的基础组件,但应与“已经实现持久自我更新的系统”明确分层。否则容易把鲁棒性、即时适应、持续学习和自我进化混成同一个概念。

  1. 如果把它作为严格的 RSI 综述,递归层讨论明显不足。

文章写出了元更新 F,也讨论了自动奖励、课程和学习方法选择,但没有建立完整的分析框架来回答:更新机制自身改变了什么、这种改变是否提高了下一轮改进效率、收益能否跨多轮持续。

因此,文中较充分覆盖的是“系统如何改进自身”,对“系统如何持续改进其改进能力”的证据整理较弱。反复训练多轮,并不能单独证明递归自我改进成立。

  1. 四类机制适合组织阅读,但不足以构成严格的自主性等级。

持续学习可以高度自主,合成数据也可以完全依赖人工流程;强化学习可以学习全新技能,并不只优化已有行为;世界模型、反思和数据生成又横跨多个类别。

作者承认类别互补,但“自主性逐级上升”的排序缺少可测量依据。更可靠的比较应同时记录:谁触发更新、谁提供目标、谁判定成功、修改是否持久、需要多少人工干预。

  1. 人形机器人这一核心对象,与实际证据之间仍有距离。

表4已经披露,许多关键证据来自机械臂、四足机器人、仿真环境或软件智能体。跨平台借鉴有价值,但它们不能直接证明完整人形机器人能同时处理双足平衡、灵巧操作、身体磨损和长期自主更新。

更需要补充的是一张“证据成熟度表”:每项研究是否真实部署、运行多久、更新多少轮、是否自主触发、保留了哪些旧能力、发生过多少干预或失败。现有表格还不足以支撑“长期自我进化已经走到哪一步”的判断。

  1. 世界模型被赋予了较强的验证职责,但验证可信度没有充分展开。

预测下一段动作,与认证一个新策略在大量未知情况下安全,是不同难度的问题。

当生成数据、优化策略和验证行为依赖相同或高度相关的模型时,它们可能共享同一种错误:模型生成错误经验,策略利用这种误差,而验证器仍认为结果合理。作者意识到了模型失准,但没有充分说明如何建立独立检查、误差边界和真实世界校验机制。

同样,小参数更新不必然意味着小行为变化;冻结基础策略,也不自动保证加入适配器后的整体行为安全。

  1. “安全能力不退化”和“回滚到旧版本”仍缺少可操作条件。

安全能力应在什么环境分布上比较?允许多大统计波动?需要多少次测试?身体受损后,旧性能上限本来就无法达到时应如何处理?文章尚未明确这些条件。

此外,软件回滚无法撤销物理磨损。机器人更换手部或执行器后,过去验证过的控制器可能已经不适合当前身体。因而,回滚需要同时考虑软件版本与身体状态是否兼容。

  1. 四个评测指标方向正确,但还不是完整、严谨的实验协议。

式5存在几个需要补充的细节:

请添加图片描述

尤其需要注意,式5用 s_tau 不属于C(s_tau) 表达违反约束,而前文 C(s_tau) 更接近“从当前状态出发允许接受的候选更新集合”。更新准入与运行时安全事件的定义还需要进一步分开。

  1. 综述方法的透明度和结论强度仍需改善。

正文没有清楚交代可复现的文献检索流程、检索截止日期、筛选过程和证据质量评估。三条自我进化判据属于概念定义,不能代替完整的文献筛选方法。

同时,文章引用了许多不同平台、不同任务上的成功率和提升幅度,却没有统一的成本口径与横向比较。第23页将现有平台组合成新基准主要视为工程任务,也低估了漂移设计、任务难度、人工介入和长期安全统计的研究难度。

对这篇综述最有帮助的改进,是明确标记每个结论属于已验证能力、可迁移的组件证据,还是作者提出的研究框架,并据此重新校准“自主性增强”“更易验证”和“长期持续改进”等表述的强度。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐