一句话先扔这儿:GPT-5.6、Claude Opus 5、Qwen3.8 谁更强,这事重要吗?重要,但远没有另一件事重要——你的 AI 外面那层"脚手架",才是它能不能干活的关键。 而 8 月一篇被疯狂低估的 arXiv 论文,刚好把这件事,连同"Vibe Coding"和"机器人"这两摊看似不相干的事,一次全说透了。

Thea 论文导读

核心观点

热门动态只是浪花

模型不是关键

harness 才是关键

两大鸿沟

读世界状态

判断动作成败

Thea 的三个支柱

Scene Graph 场景图

Evaluator 评估器

Embodiment Profile 本体配置

实验结果

三档任务成功率最高

长任务不崩

启示

Vibe Coding 工程化

具身智能补基础设施

两者收敛为同一门工程学


这一周 AI 圈吵得有多凶,随便扫一眼就头晕。

Lovable 估值干到 133 亿美元;SpaceX 拿 600 亿美金把 Cursor 吞了,转头又去摸 Cognition(Devin 那个团队)的门;小红书"小工具"全面上线,人人都能 vibe coding 一把;AWS 拉着 Superblocks 把"氛围编程"塞进企业私有云;字节 Trae 3.0、阿里 Qoder、腾讯 CodeBuddy 在自家地盘上修围墙;具身那边也不消停——8 月 19 号世界机器人大会在北京开锣,谷歌 Gemini Robotics 2 说实现了"全身智能控制",智元登顶,宇树冲科创板。

标题一个比一个炸。但说句难听的:这些热闹,全是海面上的浪。真正推着两块大陆靠拢的那股洋流,藏在 8 月 3 号挂上 arXiv 的一页页 PDF 里。

它就是《Towards the Harness of Embodied Agents》(arXiv:2608.11246,项目主页 eit-hai.github.io/thea)。

我之所以敢说"单条信息价值最高",是因为别的动态都在比谁钱多、谁收购谁、谁的机器人会跳梅花桩;只有它,捅破了一个所有人心里有数、却没人敢明说的窗户纸——

AI Agent 行不行,模型说了真不算。


先泼盆冷水。

论文第一句差不多就是这个意思:编程智能体的成功,已经把 “harness” 立成了一套范式。harness 这词直译是"马具"——马能拉车,不全因为马好,还因为有一整套缰绳鞍具把劲传到了车上。搬到 AI 里,它就是模型外面那层玩意儿:怎么调工具、怎么读你的代码库、怎么管一个 shell、怎么判断"活儿到底干完没"、翻车了怎么爬起来。

你拿今年 Vibe Coding 的演进对照一下,立马就懂。Claude Code 的 hooks、subagents、skills、MCP;Cursor 的云 agent 加 worktree 隔离;Codex 的并行线程…… 几家打得头破血流,拼的早不是"谁模型更聪明",是"谁那层 harness 更会办事"。同一个 Claude Opus 5,扔在裸聊天框里和扔在调教好的 Claude Code 里,出来的东西天差地别。模型一根毛没变,变的是外头那副骨架。

这篇论文牛在哪?它没停留在"行业心照不宣",而是把这套东西提炼成能迁移的方法论,然后甩出一个要命的问题:

既然 harness 在软件里这么灵,那在物理世界里——也就是机器人身上——它还能不能照搬?


那为什么机器人还这么"蠢"?

论文最狠的一步,是点出软件世界"白送"、物理世界"明抢"走的两样东西。

第一,读世界状态的能力。写代码时你想知道变量啥样、文件长啥样、进程退没退,随时看——stdout、文件系统、调试器,现成的。可你让机器人"看看桌上现在都有啥",难如登天:摄像头画面是转瞬即逝的像素流,没有一份"当前世界状态清单"让你 grep。

第二,判断动作成败的能力。代码跑完有个退出码:0 成,非 0 败,一清二楚。可机器人"把水杯抓起来没?"物理世界不会给你吐任何数字。抓空了、抓歪了、放斜了,全靠人眼猜。

就这两道缝,把端到端的具身模型(VLA)在真实长任务里坑惨了——错会一层层叠,还没人知道它早就错了。


Thea 干了件特别"贼"的事。

物理世界不肯给,它就自己造。

成功或进行中

失败及原因

感知与执行数据流

Scene Graph 场景图

Evaluator 评估器

Agent 生成的物理动作

继续执行

调整下一步

Embodiment Profile 本体配置

统一 Harness 循环

其一,Scene Graph as Context(场景图即上下文)。它养一张持久的、以物体为中心的符号化"世界地图":节点是物体(带 ID、粗 3D 框、置信度、新鲜度)和容器,边是空间关系(on / inside / near)。两个数据流喂它:感知(视觉、深度)和执行(只有被 evaluator 盖章的动作结果才改图)。飘忽的传感器数据,被压成一份稳定、可寻址的符号表示。模型每轮拿到的不是"一张图",是一份精炼"场景简报",要细节还能按需调(get_image、get_object_relations)。

人话版:它让机器人能像读代码库一样"读"世界。

其二,Evaluation as Exit Codes(评估即退出码)。每个操作动作之后,挂一个独立的 Evaluator。它不看模型自卖自夸,只看"当前画面 + 这个动作的事后条件",吐一个三态判定:Success / Failure / In Progress,外加结构化失败原因(“夹爪合上了但没提起来”“离目标太远”)。这判定,就是物理世界的"退出码"。一失败,Agent 拿着原因去改下一步,而不是闭眼瞎重试。

再顺手加一把 Embodiment Profile(本体配置):一份写清机器人身体极限的文档(底盘、臂展、传感器、相机位)。靠它,同一套 harness 能驱动不同机器人——论文实测了 Astribot S1、AgileX Cobot Magic、宇树 G1。

哦对,编程 Agent 那套家当它几乎全搬来了:自主循环、上下文工程、工具协议(对齐 MCP)、Skills、Memory(跨会话 MEMORY.md + 记失败模式的 tool_experience)、Safety(执行前确定性安全检查,不归模型"心情"管)。


结果有多离谱?

真实机器人、真实环境,三档任务:L1 单次抓放;L2 同桌子多次循环;L3 跨房间导航加操作,去别的屋取物再送回。

对照组拉来了端到端 VLA(ACT、π0.5、LingBot-VLA-V2)、Coding-as-Policy(CaP-X)、分层规划(SayCan)。结论就一句:Thea 三档成功率全最高;更要命的是,任务越长,端到端策略因错误累积哗哗往下掉,Thea 纹丝不动。

这点才是真金白银。长时序不崩,意味着"一句话指挥机器人干完一整套家务"从 PPT 掉进了现实门槛里。而它的秘诀,不是更大的模型,是那套 harness 把"读状态"和"验结果"的闭环补上了。


说点扎心的。

写到这我想脱离论文,聊点更私人也更实在的。

我们这拨人学 AI,特别容易焦虑:今天 GPT-5.6,明天 Opus 5,后天 Qwen3.8,永远在追最新模型,好像漏一个就完了。Thea 这篇,像一盆温和的冷水——

模型是你的马力,harness 才是方向盘、仪表盘、底盘。马力再猛,没这套东西,车都开不出车库。

做 Vibe Coding 的(比如你我),别再只琢磨"怎么把 prompt 写得骚"了,去学怎么设计 agentic loop、怎么接 MCP、怎么写 evaluation,把"它说干完了"变成"系统验过它真干完了"。这套工程素养,正在变成新的硬通货。

做具身智能的,Thea 是记迟到但及时的耳光:机器人瓶颈未必是脑不够聪明,是没人给它一份"世界状态清单"和一个"退出码"。补上这俩基础设施,老模型都能回春。

而最让人兴奋的是——Vibe Coding 和具身编程,正收敛成同一门工程学。 软件 Agent 和物理 Agent,用的同一套零件:循环、工具、记忆、评估、安全。会造一个的人,正在拿到造另一个的 pass。


最后一句大实话。

回到开头那周喧嚣。Lovable 的估值、SpaceX 的收购、机器人大会的人潮,都是浪花。Thea 这封技术报告,是海平面下那股洋流。它冷冷撂下一句:别再问"哪个模型最强",改问"你给模型配了多好的 harness"。

下次你对 AI 说"帮我写个登录页",或者"帮我拿瓶水"——记住,你真正在使唤的,不是那个模型,是它外面那层,正把魔法一点点拧成工程的,harness

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐