以为堆模型就能赢?8月这篇神论文,把AI圈最大的谎言当众撕了
一句话先扔这儿:GPT-5.6、Claude Opus 5、Qwen3.8 谁更强,这事重要吗?重要,但远没有另一件事重要——你的 AI 外面那层"脚手架",才是它能不能干活的关键。 而 8 月一篇被疯狂低估的 arXiv 论文,刚好把这件事,连同"Vibe Coding"和"机器人"这两摊看似不相干的事,一次全说透了。
这一周 AI 圈吵得有多凶,随便扫一眼就头晕。
Lovable 估值干到 133 亿美元;SpaceX 拿 600 亿美金把 Cursor 吞了,转头又去摸 Cognition(Devin 那个团队)的门;小红书"小工具"全面上线,人人都能 vibe coding 一把;AWS 拉着 Superblocks 把"氛围编程"塞进企业私有云;字节 Trae 3.0、阿里 Qoder、腾讯 CodeBuddy 在自家地盘上修围墙;具身那边也不消停——8 月 19 号世界机器人大会在北京开锣,谷歌 Gemini Robotics 2 说实现了"全身智能控制",智元登顶,宇树冲科创板。
标题一个比一个炸。但说句难听的:这些热闹,全是海面上的浪。真正推着两块大陆靠拢的那股洋流,藏在 8 月 3 号挂上 arXiv 的一页页 PDF 里。
它就是《Towards the Harness of Embodied Agents》(arXiv:2608.11246,项目主页 eit-hai.github.io/thea)。
我之所以敢说"单条信息价值最高",是因为别的动态都在比谁钱多、谁收购谁、谁的机器人会跳梅花桩;只有它,捅破了一个所有人心里有数、却没人敢明说的窗户纸——
AI Agent 行不行,模型说了真不算。
先泼盆冷水。
论文第一句差不多就是这个意思:编程智能体的成功,已经把 “harness” 立成了一套范式。harness 这词直译是"马具"——马能拉车,不全因为马好,还因为有一整套缰绳鞍具把劲传到了车上。搬到 AI 里,它就是模型外面那层玩意儿:怎么调工具、怎么读你的代码库、怎么管一个 shell、怎么判断"活儿到底干完没"、翻车了怎么爬起来。
你拿今年 Vibe Coding 的演进对照一下,立马就懂。Claude Code 的 hooks、subagents、skills、MCP;Cursor 的云 agent 加 worktree 隔离;Codex 的并行线程…… 几家打得头破血流,拼的早不是"谁模型更聪明",是"谁那层 harness 更会办事"。同一个 Claude Opus 5,扔在裸聊天框里和扔在调教好的 Claude Code 里,出来的东西天差地别。模型一根毛没变,变的是外头那副骨架。
这篇论文牛在哪?它没停留在"行业心照不宣",而是把这套东西提炼成能迁移的方法论,然后甩出一个要命的问题:
既然 harness 在软件里这么灵,那在物理世界里——也就是机器人身上——它还能不能照搬?
那为什么机器人还这么"蠢"?
论文最狠的一步,是点出软件世界"白送"、物理世界"明抢"走的两样东西。
第一,读世界状态的能力。写代码时你想知道变量啥样、文件长啥样、进程退没退,随时看——stdout、文件系统、调试器,现成的。可你让机器人"看看桌上现在都有啥",难如登天:摄像头画面是转瞬即逝的像素流,没有一份"当前世界状态清单"让你 grep。
第二,判断动作成败的能力。代码跑完有个退出码:0 成,非 0 败,一清二楚。可机器人"把水杯抓起来没?"物理世界不会给你吐任何数字。抓空了、抓歪了、放斜了,全靠人眼猜。
就这两道缝,把端到端的具身模型(VLA)在真实长任务里坑惨了——错会一层层叠,还没人知道它早就错了。
Thea 干了件特别"贼"的事。
物理世界不肯给,它就自己造。
其一,Scene Graph as Context(场景图即上下文)。它养一张持久的、以物体为中心的符号化"世界地图":节点是物体(带 ID、粗 3D 框、置信度、新鲜度)和容器,边是空间关系(on / inside / near)。两个数据流喂它:感知(视觉、深度)和执行(只有被 evaluator 盖章的动作结果才改图)。飘忽的传感器数据,被压成一份稳定、可寻址的符号表示。模型每轮拿到的不是"一张图",是一份精炼"场景简报",要细节还能按需调(get_image、get_object_relations)。
人话版:它让机器人能像读代码库一样"读"世界。
其二,Evaluation as Exit Codes(评估即退出码)。每个操作动作之后,挂一个独立的 Evaluator。它不看模型自卖自夸,只看"当前画面 + 这个动作的事后条件",吐一个三态判定:Success / Failure / In Progress,外加结构化失败原因(“夹爪合上了但没提起来”“离目标太远”)。这判定,就是物理世界的"退出码"。一失败,Agent 拿着原因去改下一步,而不是闭眼瞎重试。
再顺手加一把 Embodiment Profile(本体配置):一份写清机器人身体极限的文档(底盘、臂展、传感器、相机位)。靠它,同一套 harness 能驱动不同机器人——论文实测了 Astribot S1、AgileX Cobot Magic、宇树 G1。
哦对,编程 Agent 那套家当它几乎全搬来了:自主循环、上下文工程、工具协议(对齐 MCP)、Skills、Memory(跨会话 MEMORY.md + 记失败模式的 tool_experience)、Safety(执行前确定性安全检查,不归模型"心情"管)。
结果有多离谱?
真实机器人、真实环境,三档任务:L1 单次抓放;L2 同桌子多次循环;L3 跨房间导航加操作,去别的屋取物再送回。
对照组拉来了端到端 VLA(ACT、π0.5、LingBot-VLA-V2)、Coding-as-Policy(CaP-X)、分层规划(SayCan)。结论就一句:Thea 三档成功率全最高;更要命的是,任务越长,端到端策略因错误累积哗哗往下掉,Thea 纹丝不动。
这点才是真金白银。长时序不崩,意味着"一句话指挥机器人干完一整套家务"从 PPT 掉进了现实门槛里。而它的秘诀,不是更大的模型,是那套 harness 把"读状态"和"验结果"的闭环补上了。
说点扎心的。
写到这我想脱离论文,聊点更私人也更实在的。
我们这拨人学 AI,特别容易焦虑:今天 GPT-5.6,明天 Opus 5,后天 Qwen3.8,永远在追最新模型,好像漏一个就完了。Thea 这篇,像一盆温和的冷水——
模型是你的马力,harness 才是方向盘、仪表盘、底盘。马力再猛,没这套东西,车都开不出车库。
做 Vibe Coding 的(比如你我),别再只琢磨"怎么把 prompt 写得骚"了,去学怎么设计 agentic loop、怎么接 MCP、怎么写 evaluation,把"它说干完了"变成"系统验过它真干完了"。这套工程素养,正在变成新的硬通货。
做具身智能的,Thea 是记迟到但及时的耳光:机器人瓶颈未必是脑不够聪明,是没人给它一份"世界状态清单"和一个"退出码"。补上这俩基础设施,老模型都能回春。
而最让人兴奋的是——Vibe Coding 和具身编程,正收敛成同一门工程学。 软件 Agent 和物理 Agent,用的同一套零件:循环、工具、记忆、评估、安全。会造一个的人,正在拿到造另一个的 pass。
最后一句大实话。
回到开头那周喧嚣。Lovable 的估值、SpaceX 的收购、机器人大会的人潮,都是浪花。Thea 这封技术报告,是海平面下那股洋流。它冷冷撂下一句:别再问"哪个模型最强",改问"你给模型配了多好的 harness"。
下次你对 AI 说"帮我写个登录页",或者"帮我拿瓶水"——记住,你真正在使唤的,不是那个模型,是它外面那层,正把魔法一点点拧成工程的,harness。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)