编程代理的下一站,是给自己造一具“身体“
凌晨两点,实验室的灯还亮着。
机械臂第三次尝试抓取那只马克杯,前两次都在最后两厘米脱手——不是算法看不懂杯子在哪,而是"看得见”和“抓得住”之间,隔着一条肉眼看不见的鸿沟。工程师改了一版控制参数,重新部署,第四次,杯子被稳稳拎起,稳稳放下。整个房间安静了两秒,然后有人轻轻说了句:成了。
这个瞬间,是所有写代码的人都能共情的瞬间。代码这种东西,第一次让现实世界"听话"的成就感,会上瘾。
但请注意这个画面里一个容易被忽略的细节:刚才那句"改了控制参数",很可能是 AI 写的。不是 AI 帮你补全一行函数,而是 AI 像你一样,盯着机器人的关节角度和力矩曲线,自己把代码改了。
这不是科幻片的剧本。这是 2026 年 8 月 20 日,宇树科技创始人王兴兴在世界机器人大会上,亲口描述的正在发生的事。
1. 程序员这一天看到的世界
8 月 20 日,如果你是一个程序员,你的信息流大概率被这几条新闻刷屏了:
- Slack 发布了 Slack Code,把 Claude Code、Devin、Copilot、Vercel 四家编程代理塞进同一个聊天频道。CEO Benioff 喊出“Don’t code alone”(不要独自写代码),管这叫“真正的多人编程”。翻译一下:AI 要正式成为你的同事了,还是带工位的那种。
- Claude Code 的增长神话被戳破:ARR 环比增速暴跌到 5.2%,同期 OpenAI Codex 涨了 20.8%。导火索之一是 Anthropic 给 Claude 加了“统计水印”(为合规欧盟 AI 法案),创作者觉得自己的原创作品被“污染”了,引发退订潮;Cursor 甚至打出“退订 Claude 截图,送你 200 美元”的补贴战。
- 轻量级代理扎堆:Vercel Labs 开源了 6MB 的 Zig 原生编码代理 fx;xAI 推出终端原生的 Grok Build,一次能派 8 个子代理并行干活;高通系的 Mojo 语言宣布全面开源。
如果你是这几年的从业者,看到这些消息,心情大概率是复杂的。一边是“AI 十分钟写完了我三天的活”的兴奋,一边是“那我算什么”的隐隐不安。这个情绪很真实,不用觉得羞耻——因为就连做这些工具的公司,也正在用脚投票。
但我想说的是:今天真正值得你警惕的,不是又出了哪个更好用的工具。 而是一条热度被压过、信息密度却高得多的消息。它来自北京亦庄,来自一台会站起来的机器。
2. 王兴兴说了什么:让 AI 自己去写机器人的代码
在 2026 世界机器人大会主论坛上,王兴兴的演讲题目叫《从展品到产品:人形机器人产业的下一个十年》。他没有讲那些"“翻跟头、跑酷”"的酷炫视频,而是先泼了两盆冷水:
瓶颈一:作业效率低于人工。 现有机器人能完成简单装配,但干得比人慢、比人糙——这也是为什么人形机器人至今没能大规模进工厂。
瓶颈二:泛化能力不足。 在固定场景里训练充分,任务成功率能接近 100%;可一旦物品换了、环境变了、光线变了,成功率断崖式下跌。换个新任务还要重新训练,成本极高。
然后他拆了更深一层的原因,这句话值得每个写代码的人认真读一遍:
语言模型的输入输出都在数字向量空间,几乎没有误差损耗;但机器人的每一次感知、决策、执行都会累积误差——末端操作的毫米级偏差,最终会导致任务直接失败。““最后一点点误差,它没办法很好地去修正。””
这句话,如果你写过浮点运算、调过 PID、修过那种"本地好好的上生产就崩"的 bug,你会秒懂。数字世界允许“差不多正确”,物理世界只认“分毫不差”。 这就是具身智能和普通 AI 之间,那道最残忍的墙。
而宇树的解法,是一个让程序员脊背发凉的方案——物理 AI 机器人自进化。它的完整闭环如下(图 1):
图 1:物理 AI 机器人自进化闭环流程
注意几个细节,每一条都值得停下来想想:
细节 1:角色反转了。 过去 AI 是被编程的对象——我们写代码让 AI 干活。现在 AI 是编程的主体——它自己检索论文、自己写控制代码、自己看结果。王兴兴原话是:过去 AI 技术多用于通用编程开发领域,在机器人实体开发场景中深度应用欠缺。翻译过来就是:机器人这个行业,还没被 AI 编程"卷"过。现在要开始卷了。
细节 2:它是闭环,不是一次性生成。 代码不是写完就完,而是"仿真—真机—评价—再生成"无限循环。失败的经验会回流到下一轮。这跟 vibe coding 的本质区别在于:vibe coding 写错了,你 Ctrl+Z;机器人写错了,它可能已经摔了。
细节 3:技能会沉淀。 传统机器人是"“一机一模型、一场景一技能”“,做完一个任务,能力带不到下一个场景。而自进化体系里,每一轮产生的数据、代码、训练结果、真机反馈,都沉淀成一个不断长大的"技能库”。它不只是在学会一件事,而是在学会"“怎么学会一件事”"。
这里插一句背景,会让你对这条新闻的判断更立体:宇树这家公司,创始人王兴兴是宁波大学硕士出身,读研时就独立做出一台四足机器人 XDog,2017 年离职创业,早期靠开源机器人社区起家,一路做到今天(据公开报道)。2025 年春晚舞台上扭秧歌的人形机器人 H1,就是宇树的。换句话说,这不是一家"讲 PPT"的公司,这是一家"真的把机器人造出来卖"的公司。 它说要让 AI 自己写机器人的代码,含金量跟互联网大厂发一篇技术博客,不是一回事。
3. 技术深挖一:AI 在机器上,写的到底是什么代码
很多人听到 “AI 生成机器人控制代码” 的第一反应是:不就是让它写 Python 吗?差别没那么简单。一台机器人要"自主抓杯子",它的代码从来不是一段,而是一整条流水线,大致分三块。
3.1 感知管线:让机器"看见"
相机拍到的是一堆像素,不是“杯子”。感知层的任务是把像素变成可计算的状态:
- 目标检测与位姿估计:把杯子在图像里框出来,进一步估计出它在相机坐标系里的 6D 位姿(位置 xyz + 姿态 roll/pitch/yaw);
- 状态估计与滤波:把视觉、惯性测量单元(IMU)、关节编码器的读数融合,用卡尔曼滤波(Kalman Filter)这类算法,估计机器人自身和物体的实时状态——因为单靠任何单一传感器都不够准、不够快。
传统上这一层全是工程师手写的视觉算法 + 滤波调参,光标定相机外参就能劝退半个团队。
3.2 决策与规划:决定“下一步怎么动”
拿到状态之后,要回答“接下来干什么”。这里分两个粒度:
- 任务级规划:把"抓杯子"拆成子目标——移到杯子上方 → 下降 → 闭合手指 → 抬起 → 放回。传统实现用状态机或行为树,写清楚每个状态之间的转移条件;
- 动作级规划:在两个子目标之间,生成一条平滑、不撞东西的轨迹。经典做法是采样类规划(如 RRT*)或模型预测控制(MPC)。
MPC 是这一层的重头戏,它的思想一句话讲透:在每个时间步,基于当前状态,滚动地预测未来 N 步,求解一个带约束的最优控制问题,只执行第一步,然后重来。 示意代码如下:
# MPC 核心:滚动时域优化(伪代码示意)
for t in range(T):
solve minimize sum_{k=1..N} ( ||x_pred[k] - x_ref[k]||_Q^2 + ||u[k]||_R^2 )
subject to:
x_pred = dynamics(x_current, u) # 动力学模型前向预测
q_min <= q[k] <= q_max # 关节角度物理约束
tau_min <= tau[k] <= tau_max # 力矩执行器约束
u_exec = u[0] # 仅执行第一步
x_current = observe() # 重新观测,滚动重算
看到没有:“位置误差 + 控制量”的加权权衡、物理约束、滚动重算——这三件事,正是所有“控制”类代码的灵魂。传统工程师的日常,就是在这个目标函数里加权重、调约束,改一行参数,跑一遍仿真,再改。深夜实验室里那种"改到第 37 版才稳"的经历,写代码的人都能脑补出来。
3.3 执行控制:把决策变成肌肉
规划算出"末端该往哪走",但真正干活的是一颗颗电机。执行层要把"末端目标"翻译成每个关节的力矩指令:
- 底层:PID 或计算力矩控制,让关节跟踪目标角度;
- 高级:阻抗控制 / 力控——不是死板地"走目标位置",而是让机械臂像有弹性的手臂一样,碰到东西就顺从。抓杯子捏不碎、拔插头不掰断,全靠这个。
到这里你应该明白了:“让 AI 写机器人代码”= 让 AI 同时搞定感知、规划、控制这三层的代码,并在仿真和真机上反复验证。 这就是为什么它比 vibe coding 难一个数量级——写网页的 AI 只需要懂"逻辑",写机器人的 AI 还得懂"物理"。
4. 技术深挖二:从仿真到真机,最难的一公里
自进化闭环里有一句轻描淡写的话——“先仿真,后真机”。这四个字背后,是机器人领域最著名的坑:Sim-to-Real Gap(仿真到现实的鸿沟)。
4.1 为什么仿真里跑得好,真机必然翻车
因为仿真环境是"理想化"的:
- 物理参数不真实:摩擦系数是设定值,现实中两块接触面的摩擦每天都不一样;电机延迟、齿轮间隙、电池电压下降导致力矩变化,仿真里都没有;
- 传感器不真实:仿真里的相机图像干净得像 CG 渲染,真机的镜头有噪声、有反光、有运动模糊;
- 环境不真实:仿真里桌子是平的,现实里桌面有油渍、有歪斜。
于是出现了一个经典到有点好笑的现象:代码在仿真里跑一万次成功,真机第一次就翻车。 王兴兴演讲里那个"最后几毫米抓不住",一半就是 sim-to-real 造成的。
4.2 业界怎么对付这道鸿沟:三招
招数一:域随机化(Domain Randomization)。 既然仿真参数不真实,那就把仿真参数"随机化"——摩擦系数随机、质量随机、延迟随机、光照随机。让策略在"参数抖动"的环境里训练,练出一个"无论世界怎么变都能凑合活"的鲁棒策略。这是用训练多样性,对冲环境不确定性。
招数二:系统辨识(System Identification)。 反过来,精确测量真机的动力学参数(惯量、摩擦、刚度),把测到的真实参数回填进仿真,让仿真"长得像真机"。这是让仿真变准。
招数三:Real-to-Sim 数据回流。 把真机上采到的数据(轨迹、力矩、触觉)喂回仿真校准模型。这是让仿真持续跟着真机进化。
三招经常叠加用。这也是为什么自进化闭环必须是"闭环"——仿真的可信度,本身要靠真机数据持续校准。
4.3 误差累积:为什么“最后几毫米”这么难
回到王兴兴的原话。误差不是一步产生的,是链路叠加的:
相机像素误差 → 位姿估计误差 → 轨迹规划误差 → 关节跟踪误差
(几像素) (毫米级) (毫米级) (电机误差)
每一步都"差不多",乘起来就是"差很多"。工程师缓解它靠三件套:
- 闭环反馈:不靠“算一次就执行完”,而是实时用传感器校正——走偏了立刻拉回来;
- 力控/阻抗控制:末端接触时感知力,用“柔顺”替代“死磕位置”,让最后几毫米的误差被物理地“消化”掉;
- 视觉伺服:执行过程中不断“看着目标修正”,而不是闭眼走过去。
你会发现,这三件套的共性只有一个:不信任开环计算,永远用反馈兜底。 这跟写分布式系统“不信任网络、永远做重试”是同一个哲学——但机器人没有“重试”的优雅,它摔一次,物理上就失败了。
5. VLA 与世界模型:背题库和懂物理的差别
前面提到决策层有两条技术路线,这是 2026 年具身智能圈最核心的争论,值得单独讲透。
5.1 VLA 模型(Vision-Language-Action)
原理:输入“图像 + 语言指令”,直接输出“动作”。端到端,不绕弯子。实现上常用“动作即文本”的 trick——把连续动作(比如“末端移动 5.2 厘米”)离散化成 Token,让大语言模型像“写下一个字”一样“预测下一个动作”。
代表路线:从 RT-2 这类“把机器人当多模态 LLM 训”的思路,到 OpenVLA 这类开源 VLA 生态,这两年进展很快。
优势:简单、直接、能借用大模型已有的语言/视觉常识(“杯子”、“打开”这些概念不需要重新学)。
致命短板:它本质是“看什么 → 做什么”的映射,对物理世界没有显式建模。遇到没见过的场景、需要长程推理的任务(比如"把积木按颜色分类堆好"),容易走一步看一步、忘了目标。这正是王兴兴说的"泛化不足"的根源之一。
5.2 世界模型(World Model)
原理:让 AI 在内部建立对物理世界的预测能力——给定当前状态和一个动作,模型能预测"世界接下来会变成什么样"。有了这个能力,机器人在动手之前,可以在"脑内"先试错:想象自己这么动,杯子会不会翻? 相当于给机器人装了一个"脑内模拟器"。
两条技术路线(这是关键知识点):
- 基于视频生成:训练模型生成“未来几秒的画面”,把预测结果当规划依据(Sora 类技术的机器人版)。宇树从 2024 年初启动的,就是这条路——用视频生成做世界模型,是 2026 年行业公认的核心方向;
- 基于隐空间预测(JEPA 类):不生成像素,而是预测抽象特征(“杯子在画面中的语义位置”),更省算力、更抗噪声,但解释性差一些。
为什么难:世界模型“预测得准”,不等于“控制得好”——预测网络和控制器是两个系统,怎么把它们耦合起来(典型如让世界模型给 MPC 当“前瞻”),至今没有标准答案。
一句话总结这两条路的差别:VLA 是背题库考试,题型一变就懵;世界模型是理解了物理定律之后现推,题目再新也能试试。 后者,才是通往“泛化”的路。
6. 自进化闭环:机器人世界的 CI/CD
如果你做过工程,会发现宇树这套"自进化"体系,长得特别像你天天在用的 CI/CD + 自动化测试——只是流水线的产物从"代码"变成了"会动的策略"。我们把这六步当工程系统拆开看:
| 环节 | 传统机器人开发 | 自进化体系 | 关键难点 |
|---|---|---|---|
| ① 查资料 | 工程师读论文、翻 GitHub | AI 智能体检索论文/开源方案 | 需要机器人领域知识库(RAG) |
| ② 写代码 | 工程师手写感知/规划/控制 | 编程智能体生成多文件代码 | 多智能体协作(读论文的/写代码的/写测试的) |
| ③ 仿真验证 | 手动搭场景、肉眼盯 | 自动化测试:跑 N 个场景,统计成功率 | 成功判据怎么定?指标要可量化 |
| ④ 真机测试 | 工程师守着,怕摔 | 自动部署 + 安全围栏(限速、力矩限制、急停) | 安全性是底线 |
| ⑤ 评价 | 工程师凭经验判断"行不行" | 自动指标(成功率/能耗/轨迹平滑性)+ 人工打分 | 评价维度要跟真实需求对齐 |
| ⑥ 再生成 | 工程师改代码 | 失败原因反馈给编程智能体,下一轮优化 | 反馈回路怎么设计(类似 RLHF) |
注意第⑤步和第⑥步——这是整个系统的"灵魂",也是最像 RLHF(用人类反馈微调大模型)的地方:
- 自动评价:不能只数"成功/失败"。一个合格的评价体系要同时看任务完成度(杯子放到位了吗)、安全性(有没有撞桌沿)、效率(能耗、耗时)、平滑性(轨迹抖不抖)。这些指标本质上是给"控制代码"打分,分数就是下一轮优化的梯度方向;
- 人工反馈:工程师在真机失败案例上标注"为什么失败"——是目标丢了?是轨迹太激进?还是物理参数变了?把"失败原因"结构化地告诉编程智能体,比只给一个 0 分有用得多。 这就是"人机协同"最实在的落点:人负责判断为什么错,AI 负责去改。
而整个闭环沉淀下来的东西——每一轮的场景、代码、仿真结果、真机数据、评价——就是一个不断长大的数据飞轮 + 技能库。类比一下你就懂了:
传统机器人开发像"手工作坊":老师傅带徒弟,徒弟学会了就带走,人走茶凉。
自进化体系像"Git 仓库 + 自动化流水线":每一次尝试、每一段有效代码、每一个失败样本都被记录下来,新任务来了先检索技能库,能复用的直接复用,不能复用的在小基础上适配。
软件行业用二十年验证过的工程方法论,正在被搬进物理世界。
7. 四级演进:编程代理在爬四级台阶
把当天所有新闻摆在一起,一条清晰的进化链就出来了。AI 编程代理正在爬四级台阶,每一级,它“作用的对象”都在变重、变具体:
| 阶段 | 代表系统 | 作用对象 | 核心能力 | 主要挑战 |
|---|---|---|---|---|
| 第一级:补全 | GitHub Copilot(2021) | 代码片段 | 行内补全、函数建议 | 上下文理解、正确性 |
| 第二级:结对 | Claude Code / Codex(2025) | 代码仓库 | 端到端任务执行、测试修复 | 长程任务一致性、权限安全 |
| 第三级:协作 | Slack Code(2026-08) | 团队工作流 | 多代理协作、审计审批、归档 | 治理、上下文权限边界 |
| 第四级:具身 | 宇树物理 AI 自进化(预研) | 物理实体 | 控制代码生成、真机闭环、自进化 | 误差对齐、Sim-to-Real、安全性 |
表 1:AI 编程代理四级演进框架
每一级,都对应一个"人的瞬间",你大概率能对上号:
第一级,补全时代(2021 年)。 那是 Copilot 刚发布的日子。程序员第一次体验到"我打个函数名,AI 帮我接下半句话"的奇妙感。像是有个打字飞快、但偶尔犯傻的实习生坐在你旁边。多数人的第一反应是:这玩意儿居然真的能写对?
第二级,结对时代(2025 年)。 Claude Code、Codex 这类终端代理出现,不再是一行一行补全,而是"你给它一个任务,它改文件、跑测试、修 bug,一条龙"。无数程序员度过了人生中第一次"AI 深夜加班,我在旁边看着"的夜晚。有人兴奋,有人失眠——那种"我好像突然不是必需品了"的失落,是这代人独有的集体记忆。
第三级,协作时代(就是今天)。 Slack Code 告诉你:AI 不止是你一个人的搭档,它是团队的一员。它有专属频道、有可审计的操作记录、有代码 diff 可以审批。AI 第一次有了“工位”。 对企业来说,这意味着 AI 写代码这件事,终于可以被管理、被追责、被信任了。
第四级,具身时代(刚刚开始)。 宇树这条消息的含义是:编程代理终于要从屏幕里走出来了。它写的不再是 API 和网页,而是机械臂的力矩曲线、双足机器人的步态规划。作用对象从“一段文本”变成了“一具身体”。
你现在正处于第三级往第四级迈进的拐点上。看懂这个拐点的人,会少很多焦虑,多很多方向感。
8. 当天全景:数字世界在卷生卷死,物理世界刚开闸
为了让你相信"第四级是价值洼地",我们把当天 Vibe Coding 这条线完整摊开——它们共同指向一个结论:数字世界的编程代理,正在快速商品化,创新红利正在收敛。
Slack Code 做的是"聚合":不自己做代码生成,而是把四家代理装进一个频道,自己当撮合平台——它赌的是"模型会越来越像,入口和协作才是护城河"。Fx 和 Grok Build 做的是"轻量化 + 终端原生":6MB、Zig 编写、10 微秒级响应,说明"帮人写代码"这件事,已经卷到比谁启动更快了。Claude Code 增长放缓、用户转投 Codex、Cursor 补贴抢人——这些数字背后,是一个个开发者用真金白银的订阅做出来的选择。
请注意这个反差的荒诞感:同一天,数字世界里,AI 编程工具在为了"让用户省 5 分钟"打价格战;物理世界里,人类正在尝试让 AI 自己研发机器人——这件事如果成了,改变的是"制造业的研发方式"本身。 前者是存量市场的零和博弈,后者是增量市场的开天辟地。
9. 写在最后:给每一个写过代码的人
这篇文章写到这里,我想把话收回到"你"身上。因为我知道,看完前面这些,你心里大概率有两个问题:一,AI 会不会让我没饭吃?二,我能做点什么?
我的回答是:
第一,别慌,但别躺。 AI 编程工具越强,“会写代码”越不是稀缺品,“知道为什么要这么写”越值钱。Claude Code 能帮你十分钟写完三天的活,但它不会告诉你这个模块该不该拆、这个坑十年后会不会爆。你的“手感”、你的判断力、你对一个系统整体性的理解,依然是稀缺的。 只是它不再免费送你了——需要你主动往“理解系统”的方向修炼。
第二,具身智能是下一个低垂的果实,现在进场正当时。 好消息是,门槛没有想象中高,而且是一条非常具体的学习路径:
- 仿真环境是零成本入口:Isaac Sim、MuJoCo、Gazebo 这些仿真器全部免费/开源。下载 MuJoCo,跟着官方教程让一个虚拟机械臂动起来——半小时,你就能体会到“代码服从物理定律”和“代码服从浏览器”的差别;
- 补两块编程之外的硬底子:控制理论入门(从 PID 到 MPC,理解“反馈”和“约束”两个概念就够起步)、强化学习基础(看懂“状态—动作—奖励”这个三元组,就能看懂大部分具身论文);
- 关注工具链:Python + ROS 2 是事实标准,就像前些年的 React 一样,先会跑通一个 demo,再谈深度。
第三,多关注“误差对齐”这个技术词。 如果说未来五年具身智能有一个核心红利窗口,那就是“如何把数字世界的正确,更精准地翻译成物理世界的动作”。王兴兴反复强调的误差对齐,就是这个问题的名字。谁先把这个词研究透,谁就站在了下一波技术红利的第一排。
第四,保持“造物者”的骄傲。 你看,人类在让 AI 给自己造身体这件事上,最难的其实不是技术,是那个“改一版参数,重新部署,然后看着杯子被稳稳拎起来”的瞬间——那个瞬间的成就感,AI 感受不到。它可以把代码写到完美,但它不会在第四次尝试成功时,轻轻说一句“成了”。会说的,只有你。
凌晨两点的实验室,灯还亮着。杯子被稳稳放回桌面。屏幕上,代码还在滚动——那可能是 AI 写的。
但按下部署键的手,是你。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)