【arXiv 2026】Continual Harness:面向具身智能体的免重置自改进外骨骼论文解读|从智能体在线自改进视角
摘要
本文解读 arXiv 2026 论文《Continual Harness: Online Adaptation for Self-Improving Foundation Agents》。该论文提出Continual Harness(持续进化框架)——一个面向具身智能体的免重置自改进外骨骼框架,通过内环行动、外环精炼与在线共学习三种机制的融合,让智能体在单个连续 episode 内自动重写自己的系统提示、子代理、技能与记忆。其特别之处在于把 Gemini Plays Pokémon(GPP)中的人工精炼循环完全自动化,不依赖任何领域脚手架与环境重置。实验表明,在宝可梦 Red 与 Emerald 上,该框架以 130 美元中位成本达成 100% 里程碑(相比极简基线 215 美元/98%,成本削减约 40%),并驱动开源 Gemma-4 模型在免重置训练中持续推进游戏进度,为自改进智能体与模型-外骨骼联合训练提供了重要借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Continual Harness: Online Adaptation for Self-Improving Foundation Agents |
| 标题(中文) | 持续进化框架:面向具身智能体的免重置自改进外骨骼 |
| 作者 | Seth Karten, Joel Zhang, Tersoo Upaa Jr, Ruirong Feng, Wenzhe Li, Chengshuai Shi, Chi Jin, Kiran Vodrahalli |
| 机构 | 普林斯顿大学 · ARISE Foundation · Google DeepMind |
| 会议 | arXiv 2026 |
| arXiv | https://arxiv.org/abs/2605.09998 |
| 项目网站 | https://sethkarten.ai/continual-harness |
背景与动机:为什么具身智能体需要自己的外骨骼?
编码智能体已经拥有成熟的外骨骼:Claude Code、OpenHands、OpenClaw 用工具、记忆与规划把基础模型包装成能长时程工作的系统。但具身智能体没有等价物——面对长时程、部分可观测的决策任务(如 RPG 游戏),没有任何现成脚手架可用。
三个关键事实构成了本文的出发点:
- 无脚手架时前沿模型几乎零进展:PokéAgent Challenge 基准证明,没有领域脚手架的 frontier 视觉语言模型在宝可梦 RPG 中几乎寸步难行(karten2026pokeagent)。
- 人工精炼可行但不可扩展:本文团队的 Gemini Plays Pokémon(GPP)项目通过人工在回路逐步精炼外骨骼,成为首个通关多部宝可梦 RPG 的 AI 系统——Blue(2025 年 5 月)、Yellow Legacy 困难模式(2025 年 8 月)、Crystal 无败绩通关(2025 年 11 月)。但人工阅读轨迹并重写外骨骼,成本极高。
- 现有自动化方法依赖重置:GEPA、OPRO 等 prompt 优化方法每轮更新都要求完整 episode 重置;Reflexion 只在回合间反思;Voyager 维护 Minecraft 技能库但不做全状态结构化编辑。GPP 运行还暴露出反复出现的失败模式——不做验证的假设、脆弱的工具调用、有限的并行目标追求——这些正是需要在 episode 中途修复的问题。

图 10:研究主线 Mermaid 流程图(问题→动机→设计→方法→实验→结论,渲染时自动重排为网格布局)
基准/方法设计:外骨骼的四个组件与三种条件
外骨骼 $\mathcal{H}$ 是基础模型 $M$ 与环境之间的脚手架层,由四个组件构成:
- 系统提示 $p$:每个推理步骤提供给模型的指令与策略指导;
- 子代理 $\mathcal{G}$:可被主代理调用的专门模块(战斗策略、谜题求解、自省);
- 技能库 $\mathcal{K}$:可复用例程,包括文本级行为启发式与可执行程序(寻路器、工具包装);
- 记忆 $\mathcal{M}$:跨轨迹持续累积的事实、策略与观察。
外骨骼还暴露一组固定元工具(define_agent、run_code、process_memory 等),智能体通过它们原地编辑四个组件。实验设置三种条件:极简外骨骼 $\mathcal{H}{\min}$(仅环境接口 + 通用提示词)、手工专家外骨骼 $\mathcal{H}{\mathrm{expert}}$(A* 寻路、属性表、伤害计算器、策展目标)、Continual Harness $\mathcal{H}{\mathrm{CH}}$(从 $\mathcal{H}{\min}$ 出发自我精炼,含从零 / 引导冻结 / 引导更新三个变体)。

图 1:Continual Harness 总览——同一拓扑(环境/智能体/外骨骼/精炼器)下三种精炼者:人工在回路(GPP)→ 自动 Refiner(Continual Harness)→ 权重+外骨骼联合训练(共学习环)
分类全景:外骨骼的组成与精炼

图 11:外骨骼四组件(提示/子代理/技能/记忆)与 Refiner 四趟 CRUD 编辑的分类全景图
方法细节:两环架构与在线共学习
内环是标准智能体一步:模型 $M$ 在外骨骼 $\mathcal{H}t$ 包裹下,根据观测 $s_t=(o_t,m_t)$(帧画面 + ASCII 地图)输出按键动作 $a_t$。外环是精炼循环:预热 $W$ 步后,每隔 $F$ 步,Refiner 读取最近轨迹窗口 $\tau{t-F:t}$,识别失败签名(导航循环、工具调用失败、目标停滞、漏探索),产出四组件编辑增量 $\Delta=(\Delta p,\Delta\mathcal{G},\Delta\mathcal{K},\Delta\mathcal{M})$,外骨骼原地更新为 $\mathcal{H}_{t+1}$ 并进入下一轮行动。
Refiner 的四趟扫描分别对应四个组件:重写提示词、CRUD 子代理(创建/修复/删除)、修复技能代码、增删改记忆条目。关键性质是单调累积——早期失败签名对后续所有精炼可用,精炼质量随 episode 深度复合增长;深局失败(后期对战、多步谜题)只有免重置方法在构造上可达。

图 2:方法论总览——(a) 单 episode 内精炼:Refiner 读轨迹窗口、经元工具 API 发四组件编辑;(b) 跨迭代共学习:每轮 256 步 DAgger rollout,低奖励窗口由 Gemini-3.1-pro 重标注后 soft SFT
训练侧是模型-外骨骼共学习环,三段式管线(附录 B 细节):SFT 预热(LoRA 秩 256、8K 上下文,教师轨迹单遍训练)→ 离线 GRPO(每状态 $G=4$ 候选,Gemini-3-flash 逐步 oracle 打分,正确性 0.6 / 格式 0.4)→ 在线共学习(每轮 $K=256$ 步 DAgger rollout,成对过程奖励模型 PRM 打分:进度 0.4 / 正确性 0.3 / 推理 0.2 / 格式 0.1,低奖励窗口由 Gemini-3.1-pro 教师重标注,再做 soft SFT)。循环免重置:上一轮结束的模拟器状态直接载入下一轮。

图 8:Gemma-4 预热阶段工具调用行为——(A) SFT 把 tool_format 成功率从近零拉起;(B) 两种离线 GRPO 奖励曲线均未超过 SFT 基线,证明在线共学习不可替代
实验设计与结果:Red/Emerald 上的能力相关增益
评测协议:宝可梦 Red 与 Emerald(同类型但地图/机制/难度不同),沿用 PokéAgent Challenge 标准里程碑评估,主指标为累计按键数 → 里程碑。模型覆盖 Gemini 3 Pro / Flash / Flash-Lite 与开源 Gemma-4(E2B / E4B / 26B MoE / 31B),每条件至少 3 个种子,报告种子中位数。
GPP 定量证据(附录 A):Yellow Legacy 运行中外骨骼 CRUD 操作贯穿全程而非收敛;更新高度集中在少数导航与战斗组件。四大天王终生尝试:Lorelei 18 次、Bruno 20 次、Agatha 18 次、Lance 19 次,Champion Pixel 第 4 次获胜。战斗策略代理提示词在 14 个检查点间经历增长-简化循环,最终吸收为分派五个子检查的 master 代理。

图 3:GPP Yellow Legacy 外骨骼精炼统计——(a) 每 2000 回合 CRUD 计数,持续更新而非收敛;(b) 更新最多的五个组件集中在导航与战斗
主结果(Emerald 完成率 @ 成本):
| 模型 | $\mathcal{H}_{\min}$ | 从零 CH | 引导冻结 | 引导更新 |
|---|---|---|---|---|
| Gemini 3 Pro | 98% @ \$215 | 100% @ \$130 | 96% @ \$140 | 100% @ \$110 |
| Gemini 3 Flash | 77% @ \$30 | 高方差 | 高方差 | 80% @ \$42 |
| Gemini 3 Flash-Lite | 20% @ \$11 | 3–13% | 3–13% | 3–13% |

图 4:Emerald 成本-完成率 Pareto 平面——Pro 上 CH 严格占优(100% @ \$130 vs 98% @ \$215);Flash-Lite 上所有 CH 变体劣于极简基线

图 5:里程碑 vs 累计按键——Red(11 里程碑至 Thunder Badge)与 Emerald(9 里程碑至 Knuckle Badge);CH 恢复极简基线到专家框架差距的大部分
开源模型共学习(附录 B):5 个推进运行全部跨迭代持续前进,从开局存档与中途存档出发同样有效;未训练 Gemma-4 基线零推进,跨家族负对照 Qwen3.5(27B/35B)无法离开起始区,排除了 rollout 协议伪影。

图 6:免重置 DAgger+PRM 训练——五条推进运行持续前进(实心=开局、空心=中途存档、星号=裁判验证),虚线为未训练基线零推进

图 7:Yellow Legacy battle_strategist_agent 提示词在 Elite Four 阶段的复杂度演化——节点数、决策门、图深度与最大扇出在增长与简化间循环,最终吸收为 master_battle_agent 分派结构
机制消融(附录 D):寻路技能路径代价赤字从近半降至个位数并保持(相对 Dijkstra oracle);CH 各条件累积数百次导航技能调用,而 $\mathcal{H}_{\min}$ 从不调用。子代理上下文比主代理低约一个数量级,交接后主代理可恢复目标或在 10 步内跨里程碑。

图 9:寻路技能机制——(左) top-10% 进化导航技能相对 Dijkstra oracle 的路径赤字从近半降至个位数;(右) CH 条件数百次调用 vs $\mathcal{H}_{\min}$ 零调用
结果对比总结

图 12:结果对比 Mermaid 总结图(Pro 成本削减约 40%、Flash 高方差、Flash-Lite 能力下限、Gemma-4 共学习推进)
关键发现
- GPP 里程碑:首个完成多部宝可梦 RPG 的 AI 系统——Blue(2025-05)、Yellow Legacy 困难模式(2025-08)、Crystal 无败绩(2025-11),后期出现涌现的自改进信号。
- 约 40% 成本削减:Pro 上从零 CH 以 $130 中位成本达成 100% 里程碑,极简基线为 $215/98%,无完成率损失。
- 增益随能力缩放:Pro 严格 Pareto 占优;Flash 高方差;Flash-Lite 上所有 CH 变体(3–13%)劣于基线(20%),存在自举能力下限。
- 技能在环内自改进:寻路路径赤字从约 50% 降至个位数并保持(Dijkstra oracle 对照),修复发生在失败同一 episode 内。
- 开源共学习有效:Gemma-4 在免重置 DAgger+PRM 环中 5/5 运行持续推进,负对照 Qwen3.5 无法离开起始区。
- 外骨骼是迁移单元:引导运行通过继承技能/记忆/子代理获得增益;Red 上子代理预算崩塌时里程碑回归。
- 创新模式映射(附录 C):命中 P1 扭转负载假设(把“prompt 优化需 episode 重置”放宽为在线精炼)、P11 分解并委托求解器(Refiner 持续创建专门子代理)、P13 条件化适配而非重训练(冻结模型靠上下文注入外骨骼状态适配)三个模式,且每项都有量化消融证据支撑。
局限性
- 能力下限:Flash-Lite 上所有 CH 变体劣于极简基线,精炼循环需要足够强的模型才能自举;开源模型(≤31B)尚不能同时扮演教师与学生。
- 共学习未饱和:报告了训练窗口内的持续进展,但未建立收敛点;与带重置批量训练的头对头比较仍开放。
- 残差缺口:对话密集的道馆内部与多回合对战策略,CH 尚不能稳定合成。
- 引导回归:Red 引导更新中,新子代理未经历修复循环,接管后成功率下降;作者提出复用先验与删除策略作为后续方向。
常见问题(FAQ)
Continual Harness 与 Voyager、Reflexion 有什么不同?
Voyager 在 Minecraft 中维护持续增长的技能代码库,Reflexion 在回合间进行言语反思;两者都不在同一 episode 内对外骨骼全状态(提示、子代理、技能、记忆)做结构化 CRUD 编辑。Continual Harness 的 Refiner 每 $F$ 步基于轨迹窗口原地重写四组件,失败信息单调累积。
什么是免重置(reset-free)?为什么重要?
免重置指智能体在单个连续 episode 内完成精炼与行动交替,不回到初始状态重来。prompt 优化方法(GEPA/OPRO)每轮更新需完整重置,够不到只在深局出现的失败(后期对战、多步谜题);而长时程编码、具身、运维任务中重置代价高昂或不可用,在线适配是主导性实用范式。
为什么 Flash-Lite 上 Continual Harness 反而更差?
框架增益要求模型有能力真正利用外骨骼组件。Flash-Lite 的极简基线仅达 20% 里程碑($11),所有 CH 变体跌至 3–13%——能力低于自举门槛时,精炼循环不仅无益反而拖累性能。作者将其归因于"能力下限"。
开源模型是怎么学会玩宝可梦的?
三段式:先在教师(Gemini-3.1-pro)轨迹上做 SFT 预热(LoRA 秩 256),再做离线 GRPO($G=4$ 候选)——但两者单独均无里程碑进展;只有在线共学习阶段(每轮 256 步 DAgger rollout + PRM 打分 + 教师重标注 + soft SFT)才驱动持续进步,且无需重置模拟器状态。
GPP 与 Continual Harness 是什么关系?
GPP(Gemini Plays Pokémon)是人工在回路精炼的实践验证——人类阅读轨迹并重写外骨骼,最终通关三部宝可梦 RPG。Continual Harness 把这一流程完全自动化:用 Refiner 替代人类,从极简接口出发在单个 episode 内自我精炼,并进一步与开源模型权重联合训练。
这套框架能用到真实场景吗?
作者明确指向长时程编码代理、具身机器人与运维任务——这些场景重置代价高、需要在线适配。框架的四个组件(提示/子代理/技能/记忆)与元工具设计与 Claude Code 类编码外骨骼同构,核心差异是把"人工调优"换成"自动精炼"。
参考链接
- arXiv 论文页:https://arxiv.org/abs/2605.09998
- 项目网站:https://sethkarten.ai/continual-harness
- Voyager(Wang et al., TMLR 2024):https://arxiv.org/abs/2305.16291
- Reflexion(Shinn et al., NeurIPS 2023):https://arxiv.org/abs/2303.11366
- DAgger(Ross et al., AISTATS 2011):https://arxiv.org/abs/1011.0686
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)