深度 | 「机器人大脑」正在成为新的必争之地:机器人企业集体从「卖身子」转向「卖软件」
深度 | 「机器人大脑」正在成为新的必争之地:机器人企业集体从「卖身子」转向「卖软件」
核心观点:机器人行业正在重演手机行业的剧本:硬件已经过剩,价值正从「卖身体」迁移到「机器人大脑」这个软件层。资本市场把天量融资几乎全押在 VLA 模型上,而谁能先突破「灵巧手」这块天花板,谁的大脑才能兑现价值。
证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

一、机器人行业正在发生一场价值迁移
2026 年 8 月,宇树科技登陆科创板,开盘暴涨 629%,市值一度超过 3400 亿元,2025 年人形机器人出货量全球第一。但同一周还有条被淹没的新闻:宇树自己承认,这家靠卖身体封神的公司,正在把重心转向自研的「大脑」,具身大模型 UnifoLM 已经进了自家工厂,自主装配关节电机。(据量子位)
这不是个案。过去两个月,资本市场把几乎所有的天量融资都砸向了「机器人大脑」:General Intuition 估值冲到 60 亿美元,Generalist 涨到 30 亿美元,中国的它石智航一笔 Pre-A 融了 4.55 亿美元,创全国单轮之最。与此同时,卖身体卖得最火的宇树,上市后市值一度接近腰斩;波士顿动力新版 Atlas 被曝月产仅 4 台。
一句话概括:机器人这个行业的利润结构,正在从「卖硬件」转向「卖软件/卖大脑」。
二、技术深潜:VLA 正在换掉整个机器人技能栈
要让机器人干活,传统做法是「感知→规划→控制」三件套,每换一个任务都要重新写规则。VLA(视觉-语言-动作)模型把这个逻辑整个推翻:它把视觉 + 自然语言指令,直接端到端映射成机器人的连续动作,行为不是写出来的,是像大模型一样学出来的。[A]

上图:VLA 从 Google RT 系列到国产轻量模型的主线,参数越小越靠近应用层。
演进线上有三个转折:RT-2(2023)把 55B 参数的大模型直接当机器人策略,把互联网学到的世界知识搬进机器人;π0(2024)确立「通用机器人策略」范式,零样本叠衣服、清桌面;π0.7(2026 年 4 月)被称作「机器人的 GPT-3 时刻」,第一次实现组合泛化,跨本体叠 T 恤完成度 85.6%,逼近人类顶级操作员的 90.9%。
但有个技术事实一直在泼冷水:机器人的手还没学会「像人一样拧东西」。Google Gemini Robotics 2 实测,货架取物 76.3%、多指换灯泡「拧出来」92%,「拧进去」却只有 36%。[C] 在 RoboDojo(30 个策略)评测里,最强通用策略真机平均成功率只有 12.8%,人类是 100%。(据 RoboDojo 官方评测) 大脑再聪明,手腕不会用劲,一切白搭。这也解释了为什么 2026 上半年中国灵巧手企业融资超 200 亿元、总估值超 750 亿元,大家都看出问题「在脑而不在手」,但手不突破,脑的价值就无法兑现。
三、竞争分析:三大流派,一个共同方向
把玩家归拢,大致三种范式:
| 范式 | 代表 | 打法 | 隐患 |
|---|---|---|---|
| 全栈(本体+大脑+场景) | Figure | 自研 Helix VLA + 进宝马回流数据 | 重资产、烧钱 |
| 垂直整合(算法+供应链+自家厂) | Tesla Optimus | FSD 算法 + 自家工厂当训练场 | 进度跳票 |
| 纯模型派(一套脑配多本体) | Physical Intelligence | 通用模型适配多本体 | 缺真实场景回流 |
| 开源平台派(做「Android」) | NVIDIA | GR00T + Isaac + Cosmos 全家桶 | 不直接卖机器人 |
上图:四种机器人大脑范式的对比,无论哪派都把重心压向软件层。
最值得注意的信号,是所有人都在往「大脑/软件层」压:
- NVIDIA 2026 年 1 月 CES 直接自称要当「机器人界的 Android」,发 GR00T N1.6 + Cosmos 世界模型 + Isaac 仿真的全家桶,波士顿动力、Caterpillar 都在用。[B]
- Google DeepMind 走模型路线,Gemini Robotics 一路迭代到 1.5 + On-Device。
- Figure 赌全栈,Helix 是首个控制整个人形上半身的 VLA,System 2 用 7B VLM 骨干 + System 1 用 80M 视觉运动网络。
- 中国出现「轻量反超」打法:优艾智合 FabriVLA 以 1B 参数登顶,面壁 MiniCPM-Robot 以 1.5B 参数追平 π0.5 且延迟更低,千寻以 66.09 分成为首个击败 π0.5 的国产模型。
资金方向也没有争议:中国 2025 年具身创投稿件从 173 起到 447 起、资金从 137 亿到 554 亿元,几乎全押在「大脑/预训练/世界模型」上。[B] 行业已经形成一个近乎共识的判断:单纯比本体硬件与运动控制的竞赛基本结束,下半场胜负手在大脑。

上图:两年内,机器人大脑从学术论文演变成千亿美元资本战场。
四、采用与生态:身体在量产,大脑在开源
「Demo 多、真签单进厂少」是 WAIC 2026 现场共识,但拉近看有真实落地:宇树把 UnifoLM-X1-0 放进自家工厂自动装电机;小米人形机器人进汽车产线,新工序成功率超 90%;Figure 在宝马取钢装配,30 天完成物流分拣场景微调。
这些案例有个共同点:落地最扎实的,都是「软硬一体 + 垂直场景数据闭环」的玩家。这也印证一个反直觉结论:不是大脑越通用越好用,而是谁手里有真实场景的数据回流,谁的大脑才越用越聪明。
中国机器人大脑的特色打法是全面开源:蚂蚁灵波 LingBot-VLA 2.0(6 万小时真实数据、覆盖 20 种构型)、面壁 MiniCPM-Robot(1.5B 彻底开源)、自变量 WALL-OSS(4090 单卡可训练)。[B] 为什么集体押开源?逻辑跟安卓一样:「数据 + 开发者生态 = 平台锁定」,这是一场用开源换平台地位的卡位战。
机器人大脑的燃料是数据,而这恰是它相对大模型最吃亏的地方:你不能像爬网页一样爬机器人的物理动作数据。于是出现了专门的数据产业:中国 97 家具身数据玩家,近一年 15 家数据服务商融资约 44.7 亿元,湖南甚至出现「数据采集 5S 店」,一年采 100 万小时。目前全球具身数据存量约 50 万小时,中国玩家正冲刺 2026 年底全球首个「100 万小时」。
五、战略影响:谁在卖铲子,谁在挖矿
机器人正在变成「软件定义的生意」:利润结构从卖硬件转向卖软件,重演 PC 和手机行业的剧本,硬件红海,利润都被操作系统和软件层拿走。

上图:价值链从数据到大脑、本体、平台、场景逐层重构,价值沉淀在软件与平台层。
对中国公司和工程师,有三个卡位机会:
第一,开源 + 数据规模是中国后发优势。美国在模型上限领先,但中国在量产节奏、数据采集规模、供应链上甩开一个身位。RSS 2026 上 Physical Intelligence 直言「美国具身也没成熟」,另一面是中国有机会定义更便宜更快的范式。
第二,垂直场景的数据闭环,比通用大脑的「先进」更重要。没有客户在乎一台 80% 成功率的通用机器人,客户要的是在自己产线上 98% 成功率干活的机器。
第三,对软件/模型工程师,这是一次尚未充分定价的窗口。具身模型部署成本骤降(1B 可登顶、4090 可训、约 120ms 延迟),门槛低到普通工程师也能进场;岗位需求正转向数据采集、仿真合成、人体视频蒸馏、灵巧手算法等全新工种,数据工程师缺口远比模型工程师大。[D]
六、我的判断
把整盘棋想清楚,我说几个不太顺着主流的判断。
第一,VLA 和世界模型之争,大概率不会谁赢谁输,而会走向合流。媒体爱渲染两者对撞,但蚂蚁沈宇军、NVIDIA 西雅图实验室都指向同一个方向:最终会融成「物理世界独有的模型」。我判断,未来 12-18 个月会看到大量 VLA + 世界模型混合架构,「机器人版 World Action Model」才是终局方向。
第二,机器人大脑的价值被高估了吗?我原以为是的,但数据不支持。当 General Intuition 用 8 分钟真实数据调出能跑的四足机器人,当它石智航拿到 4.55 亿美元,资本赌的不是一两家公司,而是这个赛道本身会成为下一个像 LLM 一样的独立品类。我判断这个赛道不会熄火,而会经历一次激烈的「GPT-2 时代」淘汰赛:套壳、追基准、没数据闭环的会死,少数掌握数据的赢家通吃。
第三,最被低估的是「灵巧手」这条线。钱都涌向大脑,但 36% 的拧螺丝进去、12.8% 的真机成功率都提醒:大脑的天花板被手焊死了。我预判今年下半年到明年,灵巧手/触觉这条线会迎来比大脑更猛的一波资本与人才回流。
最后,对做软件的人说句实在话:现在进场做机器人大脑,不算晚甚至算早。这行还在「GPT-2 时代」,门槛刚被开源和 1B 小模型砸下来,机会窗口是敞开的。真正的风险不是技术跟不上,而是押错「卖手机还是卖 Android」的位,我赌「软件定义」这一边。
每日更新。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)