目录

从“一个模型解决一切”到“一层组织系统”

从“单策略稳定性”到“多策略编排”

从“单机闭环”到“多机协作”

从“云端大模型”到“边云协同 + 端侧专用”

技术路线正在收敛到什么

VLA没有被淘汰,但“只靠VLA就够了”被淘汰了

2026年上半年的数据:范式基本收敛

产业落地的真实状态

从“表演炫技”到“进厂干活”

但数据仍是最大瓶颈

产业演进的三阶段预判

回到你的调研文件:这些项目各自站在哪里

一句话总结趋势

“Harness”概念的起源:来自数字智能

Harness VLA 的贡献:把 Harness 从数字世界搬进物理世界

一张表分清“谁先谁后”


从“一个模型解决一切”到“一层组织系统”

2026年最核心的认知转变是:靠更大的模型解决一切,暂时行不通了。 清华大学于超教授团队在7月发布Harness VLA时明确指出,机器人需要一层执行组织系统,让一个冻结的VLA专注于它最擅长的接触密集操控,用Harness学会何时、以何种方式调用它,以及在VLA失败后如何重置、如何重试。

这个转变在WAIC 2026上得到了最直观的体现。之前被反复强调的端到端路线所代表的VLA与世界模型之争,在今年现场的纷争少了许多。取而代之的,是通过Agent调度原子化技能、实现“一脑控多机”、精准完成规范化任务的路径模式。市场聚焦点已从模型参数转向了Agent智能体的实际落地。

从“单策略稳定性”到“多策略编排”

Harness VLA解决的是“一个模型如何在扰动下稳定发挥”,它的问题是单策略的稳定性。但真实世界的任务——比如“打开柜门、找到积木、搭成桥”——横跨VLA、RL、TAMP、WAM四种完全不同的能力,这些模型各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。

华为诺亚方舟实验室的RoboHarness面对的是另一层问题:当任务超出任何一个模型的能力边界时,怎么办? 它的答案是:与其等待某一个模型填平所有鸿沟,不如先让已经存在、各有所长的模型真正协同起来。作者有一个重要的判断:直到某一个模型能够完全压制其他所有模型、展现出绝对的统治力之前,这种编排架构都是非常有意义的

从“单机闭环”到“多机协作”

PhyAgentOS和ABot-AgentOS解决的是单个机器人的完整任务闭环。但产业端的需求已经走到了下一步:智源研究院的RoboOS用“大脑-小脑”分层架构和实时共享内存,支持多个异构机器人像一个团队一样协作。它在餐厅、家庭、超市等真实场景中验证,支持单臂、双臂、人形、轮式等多种异构本体。RoboOS 2.0的全链路平均响应时延已低于3ms。

从“云端大模型”到“边云协同 + 端侧专用”

ABot-AgentOS的边云协同设计代表了另一个趋势:不是所有事情都要交给云端大模型。 边端Tiny LLM处理每一轮交互的低延迟感知和常规决策,遇到复杂语义或长程规划时才按需调用云端Large LLM。端侧模型专用Harness进一步推进了这个方向——Perplexity的实验发现,尽管Qwen 3.8 27B提供了26万token的上下文窗口,但当token数量超过10万时,模型性能就开始下降。端侧部署需要的不是“把大模型的框架缩小”,而是框架根据模型能力量身定制,模型经过后训练以有效使用框架


技术路线正在收敛到什么

VLA没有被淘汰,但“只靠VLA就够了”被淘汰了

2026年WRC会场,“概念热”正在褪去。去年还被反复挂在展台、演讲和采访里的VLA,今年很少再被当作一个完整答案来讲。但VLA没有消失,它正在从独立技术路线变成系统里的一环

擎朗智能的表述很清晰:“VLA是核心骨架,世界模型是让它‘先想后做’的大脑皮层。机器人执行动作前先在内部预演一遍物理结果,预测物体受力后的运动轨迹、多步骤操作的因果链条,从源头规避失败。这不是用世界模型替代VLA,而是用世界模型让VLA更强。

星海图则从技术本质出发:“不管是VLA还是世界模型,本质都是把输入转化为Token,通过Transformer多层神经网络完成编码,再通过自监督方式开展预训练。二者区别仅在于自监督训练的方式不一样,世界模型主要依靠视频预测来做自监督训练。二者同源共生,未来也会走向融合。

2026年上半年的数据:范式基本收敛

2026年上半年,国内具身智能企业发布超20款大模型。从WAIC的调研来看,具身模型的范式基本收敛,方案百花齐放,路径逐渐清晰。

VLA统一架构确立了技术主流地位。通用具身大模型正从单一任务演示向跨平台泛化迈进,技术路线逐渐收敛于视觉-语言-动作的统一架构,打通感知、推理与执行的端到端闭环。通过引入世界模型与长时序记忆机制,模型在处理复杂长序列任务时的稳定性得到提升。


产业落地的真实状态

从“表演炫技”到“进厂干活”

WAIC 2026释放出清晰信号:产业从“数字智能”迈向“物理智能”,量产元年与部署态元年双重叠加,推动“让AI真正干活”从愿景变为紧迫的产业命题。

中国具身智能市场规模预计在2026年达到约1.09万亿元,全球机器人基础模型市场也看涨至千亿美元量级。2026年上半年,中国人形机器人出货超4万台,这是去年全球出货量的两倍还多。聚焦整个2026年,工信部给出了中国全年整机产量有望突破10万台的预期。

场景落地已经清晰分化:工业场景聚焦仓储物流搬运、分拣、汽车线束整理、产线精密装配;商业场景聚焦无人商店、药店值守、酒店洗衣、咖啡制作;家庭场景聚焦居家安防、物品取送、洗衣叠衣整理房间。

但数据仍是最大瓶颈

2026年WRC上,更多人开始意识到:所有没有数据支撑的算法路线之争,最后都是梦幻泡影。 无论做VLA、世界模型,还是端到端具身大模型,最后都会回到数据。没有足够多的真实物理交互数据,VLA只是把视觉、语言和动作连在一起;端到端只是把模块边界藏进模型里;世界模型也很难真正知道,一个动作之后,世界会怎样变化。

WAIC上很多展示其实都依托于提前到现场连夜采集数据、现调试模型。这意味着现阶段的数据量还没法达到让模型快速适应不同场景的程度。提升模型的泛化能力,仍然是当前商业兑现最直接的门槛。

行业正朝着亿小时合成数据、百万小时真机数据的目标推进。


产业演进的三阶段预判

业内认为产业演进将划分为三个阶段:本体百花齐放 → Agent智能体应用兴起 → 具身大模型成为核心。电机、减速器等上游零部件将率先跑出头部厂商,本体领域也将诞生平台巨头,通用人形机器人与行业专用设备将长期并行。

华泰证券的判断是:随着人形机器人本体能力趋于成熟,行业竞争的重心正从硬件转向场景开发与生态分工。本体厂缺乏人力和资源逐家交付,外部开发者正成为产业链新的一环。“场景智能”可能是一条更为现实的打破工业具身落地不可能三角的路径,操作系统、全模态采集与数据平台、能够实现跨构型部署的基座模型的价值有望凸显。


回到你的调研文件:这些项目各自站在哪里

用一张表把趋势和你的调研文件对应起来:

趋势方向代表项目它在这个趋势中的位置
单策略稳定性Harness VLA、端侧Harness最早出现,解决“一个模型不崩”
多策略编排RoboHarness紧跟其后,解决“多个模型接力”
单机完整闭环PhyAgentOS、ABot-AgentOS系统化,把规划/技能/验证/记忆全管起来
多机协作RoboOS、ABot-Claw最新方向,从单机走向群体
单一能力封装Qwen-RobotNav底层零件,被上层Agent调用
极简参考Pi agent纯软件思路,回答“最小内核长什么样”

它们不是重复,而是一条从下到上的演进链。 你之所以觉得“混乱”,是因为把这条链上的所有节点平铺在一起看了。按时间顺序或按层级去看,每一层解决的都是上一层解决不了的新问题。


一句话总结趋势

这个领域正在从“模型军备竞赛”转向“系统组织竞赛”。 模型还是那些模型,但决定成败的,越来越是谁能把它们组织得更好、验证得更准、记忆得更久、协作得更顺。Harness VLA把成功率从50%提到82.4%,VLA参数一个没变——提升完全来自系统层的组织方式。这可能就是未来几年整个领域最核心的命题。


Harness VLA 是第一个把“Harness”这个概念引入具身智能领域的,但“Harness”本身在数字智能(纯软件 Agent)领域早就存在了。

“Harness”概念的起源:来自数字智能

“Harness”最早被真正放进 Agent 领域,是 Anthropic 在 2025 年 11 月的一篇博客。那篇文章讨论的是:当 Agent 要执行的任务越来越长时,需要一个有效的 Harness 来确保 Agent 正常运作。

随后这个概念在工程圈迅速扩散:

  • 2026 年 2 月,HashiCorp 联合创始人 Mitchell Hashimoto 提出了“Harness Engineering”(驾驭工程)的理念,核心是“每当 AI 犯错,就工程化一个方案让它不再犯同样错”。

  • 2026 年 2 月 11 日,OpenAI 发布《Harness Engineering》实验报告,用“人类掌舵,智能体执行”来概括这个范式,彻底把它带入了主流视野。

  • 同期,LangChain 等团队提炼出了 Agent = Model + Harness 这个公式,Harness 被定义为“除模型本身以外的所有工作”。

所以,“Harness”这个概念的主场在数字智能——Claude Code、Codex 这类 Coding Agent 的能力提升,很大一部分来自模型之外的那层执行组织系统,而不是模型本身变大。

Harness VLA 的贡献:把 Harness 从数字世界搬进物理世界

你调研文件里看到的 Harness VLA,它的“首次”指的是另一个层面:

首次将数字智能中广泛应用的 Harness Layer 引入具身智能系统。

于超教授团队的洞察是:Coding Agent 靠 Harness Layer 实现了能力跃升,那 VLA 是否也需要属于自己的 Harness Layer?他们的答案是肯定的——底层 VLA 全程冻结,只在外面加一层组织层,成功率就从 50% 提到了 82.4%。

一张表分清“谁先谁后”

时间事件领域
2025年11月Anthropic 博客首次在 Agent 语境下使用“Harness”数字智能
2026年2月Mitchell Hashimoto 提出“Harness Engineering”数字智能
2026年2月OpenAI 发布《Harness Engineering》报告,推广该概念数字智能
2026年7月Harness VLA 首次将 Harness Layer 引入具身智能具身智能

一句话记住:Harness 概念在数字智能里已经跑了大半年,Harness VLA 是把它带到机器人领域的那个人。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐