自演化代码智能体:从数字程序到物理世界智能
26年9月来自六角未来 (HexaFuture AI)公司的论文“Self-Evolving Coding Agents: From Digital Programs to Physical-World Intelligence”。
这是一篇有价值的系统框架与初步实证论文。它较有说服力地展示了“显式状态管理+验证+恢复”能改善机器人任务执行,但对“持续自主进化”和“物理智能内化”的证明仍不充分。
一、论文的核心要点
作者关注的问题是:机器人即使具备不错的抓取、放置能力,也可能在多步骤任务中忘记子目标、错误判断完成状态,或在失败后反复执行无效动作。
论文提出 Physical Coding,用两类相互关联的程序组织物理任务:

闭环是:
观察 → 更新世界状态 → 调用动作工具 → 根据新证据验证 → 继续、恢复或停止。
VLA/WAM 在其中仍然重要,但主要充当动作工具。上层框架管理任务逻辑,并把执行经验保存为可复用程序、记忆或训练数据。
“自进化”发生在下一层:依据失败记录修改工具和流程,或利用验证过的轨迹训练新模型;候选更新经过独立评估后才被保留。
如图 1 所示“物理编码”(Physical Coding)通过一种显式的可执行接口,将人工智能引入物理世界。“代码即世界”(Code as World)表征了与任务相关的对象、关系、观测、约束及进度谓词;而“代码即策略”(Code as Policy)则统筹规划、工具调用、动作执行、验证及恢复等环节。二者共同构成了智能体与物理环境交互的核心接口,并积累了可复用的产物,从而实现持续改进。

二、方法贡献:哪些地方真正有价值
- 将状态、动作和证据放进同一套可检查接口。
“让语言模型写机器人代码”已有明确先例,例如 Code as Policies。因此,本文的主要新意应落在:把世界状态、验证条件、恢复流程和跨回合更新系统地连接起来。
尤其有价值的是记录“这个判断依据哪次观察、发生在什么条件下”。这让失败有机会被定位到感知、状态更新、工具执行或任务规划,而不仅是得到一个最终失败标签。
但这里的 Code as World 主要是任务相关状态与证据的表示,还不能等同于能预测任意物理过程的动力学世界模型。
- 把“动作结束”与“任务完成”明确分开。
系统允许验证器返回通过、失败、证据不足、受阻、安全停止等状态。低层工具返回“执行完毕”,并不意味着食材确实放进了容器。
这种设计适合多步骤任务:尽早发现局部失败,通常比在最后重新开始整项任务更有效。
- 为不同层面的改进提供归因框架。
论文明确区分:
工具或流程变好;
数据积累更多;
模型权重更新后能力变强;
换到真实环境仍然有效。
这一点很重要。作者也承认,更好的运行框架不能直接被算作模型学习,更换评估器后的高分不能直接算作泛化。
- 将机器人操作扩展到有测量依据的实验任务。
PhyBench 要求机器人操作装置、记录读数、拟合参数并提交结论。其价值在于把“动作是否完成”扩展为“结论是否有证据支持”。
不过,这些任务是已知物理规律下的参数估计,尚未涉及未知机制发现。
如图 3 所示物理编码(Physical Coding):将世界状态、策略执行与证据相互关联。物理观测和工具输出被转化为“代码即世界”(Code as World)形式,用以表征与任务相关的对象、关系、度量、约束及进度谓词。“代码即策略”(Code as Policy)利用这一表征来组织规划、工具调用、动作执行、验证及恢复流程。执行过程产生新的观测结果以更新世界表征,同时基于最新证据进行的验证则决定了后续是继续执行、重新观测、执行恢复操作还是终止任务。

如图 4 所示物理层面的自我演化。“代码即世界”与“代码即策略”理念提供一个跨越四大目标(即:控制框架、数据与环境、模型与算法、具身形态与算力)的共享且可演化的接口。执行过程中的实证数据指导候选修改方案的生成,独立的评估机制决定采纳或回滚,而经由验证的记录则为后续的学习与优化提供支撑。

如图 5 所示任务输入引导一个物理世界模型,该模型生成用于 Harness “观察-规划-行动-验证-恢复”(Observer–Plan–Act–Verify–Recover)循环的世界代码与策略代码。动作与模拟或物理环境进行交互,而经由验证的执行轨迹则提供训练数据,并推动模型、Harness 及环境的后续改进。

三、实验结果实际支持到什么程度

这里有一个容易误读的地方:PhyBench 的“有效运行”不等于“达到精度门槛的成功运行”。论文允许误差超标但流程有效的运行进入误差统计,而且平均误差只统计有效运行。因此,不能把“30/30 有效”直接理解成“30/30 全部达标”。见第22页、表6。
四、主要不足与值得质疑之处
- 对 VLA 局限的诊断,强于实验所能证明的范围。
论文发现,在 LIBERO 中去掉语言指令后,成功率仍有92.3%,有指令时为96.2%。这很好地说明:该评测可能允许模型通过场景猜任务。
但由此还不能直接推出“VLA 架构本身无法理解指令”或“增加数据和规模无法解决问题”。要检验这一点,应固定初始场景,只改变相互冲突的指令,观察动作是否随语言正确改变。
- 缺少组件消融,尚不清楚增益来自哪里。
当前整体对比同时引入了任务分解、状态记忆、验证、重试、恢复和更强规划器。缺少以下关键拆分:
仅增加任务分解,能提高多少?
在分解基础上增加验证,能提高多少?
用自然语言状态记录替代代码表示,效果是否下降?
简单状态机加相同工具,是否也能获得接近的结果?
所以现有结果支持整套系统有效,却还不足以说明其关键表示方式具有不可替代性。
- 可执行表示并不自动保证物理事实正确。
如果感知把烤箱外的食物误记为“在烤箱内”,代码中的条件判断仍可能顺利通过。
这里必须区分:
程序逻辑是否一致;
状态记录是否符合真实世界。
论文强调独立验证,但没有充分量化验证器的误报率、漏报率,以及它与规划器是否会产生相关错误。把错误写成结构化状态,可以让错误更容易检查,却不会自动消除错误。
- 模型“内化能力”的证据仍弱。
HexaModel 的训练混合了执行轨迹、具身问答、场景描述,以及数学、代码和指令数据;Harness 返回的数据约占训练 token 的38.8%。
因此,总体提升1.2个百分点,尚不能单独归因于验证和恢复轨迹。论文也没有充分展示:
等量通用数据微调的对照;
去除恢复轨迹或验证信息后的变化;
减少 Harness 辅助后是否仍保持优势;
训练轨迹与评估任务、场景、种子的具体隔离方式。
缺少多训练种子及配对统计,也使小幅优势的稳定性难以判断。
- “自主进化”实际包含显著人工参与。
工具进化中,独立编程代理修改工具,操作员选择抓取像素;折衣服的早期开发还使用过与评估同源的关键点信息。作者随后补做无特权信息复评,这种披露值得肯定,但最终留出测试也只有五个种子。
真实机器人投掷工具的迭代还包含人工示范和人工判断。因此,更准确的定位是:人参与的代理辅助工具迭代,以及初步的数据—模型反馈。
尚未展示长期、多轮、低人工干预且持续改善的完整闭环。
- 真实部署与科学实验的外推空间有限。
真实机器人每项仅三次试验,速度对比来自不同硬件和运行约束;首个拧瓶盖试验还排除了初始诊断修复阶段。因此,不能将这些数字直接解释为同条件效率优势。
PhyBench 只有三个仿真实验,也缺少其他框架的同条件基线。它证明了端到端流程可行,尚未证明对真实仪器噪声、模型失配和开放科学问题的适应能力。
此外,软件版本可以回滚,已经造成的物理后果通常不能回滚。真实部署还需要独立于高层代码的动作约束与恢复机制。
五、下一步方向
作者提出的远期方向包括模型权重、表示语言、架构、环境乃至硬件共同进化。先收紧问题,将下面三件事做扎实。

其中,最值得单独发展成下一篇方法论文的切口,是“带不确定性和证据时效性的 Code as World”:
世界状态不只保存“真/假”,还保存置信程度、观察时间、适用条件和矛盾证据;验证器据此决定是否必须补充观察;策略进一步选择最能消除不确定性的相机视角或测量动作。
这样就能把当前偏工程组织的框架,推进到一个明确的研究问题:在部分可观测的物理环境中,机器人应何时相信已有状态,何时花成本重新获取证据?
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)