具身智能的「安卓时刻」:机器人大脑平台化,硬件正在沦为躯壳 — 深度分析

这是一篇深度研究,不是新闻简报。基于 30+ 个来源的交叉验证。 证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

核心观点: 2026 年具身智能的「大脑」正与「身体」解耦——VLA 跨本体泛化、硬件走向标准化,竞争从「造机器人」转向「谁掌握通用大脑、谁掌握喂给大脑的数据」;中国以约 935 亿元融资和量产规模入场,但 2026 也是「淘汰赛元年」。

封面

一、一个反直觉的信号:大脑开始和身体「离婚」

2026 年 7 月最后一周,三个信号指向同一件事。7 月 30 日 Google DeepMind 发布 Gemini Robotics 2——三模型组成的「机器人大脑」:能让人形机器人「从脚到指尖」全身控制的 VLA、负责高层推理的 ER 2、只需不到 200 个样本就能适配新本体的端侧模型。[A] 英国 Humanoid 完成 1.52 亿美元 A 轮,Schaeffler、Bosch 以产业资本入场;Black Forest Labs 的 FLUX-mimic 把机器人微调时间从 30 多小时压到 30 分钟,正在奥迪工厂测试。[B] 国内,2026 上半年中国具身智能融资约 935 亿元、322 笔,是去年同期的约 5 倍。[B]

三个信号合起来指向一个结构变化:机器人的「大脑」正在与「身体」解耦。模型不再绑定具体硬件,而是像手机操作系统一样试图跨本体通用——硬件则越来越像标准化躯壳。这是具身智能的「安卓时刻」:当大脑变成平台,主战场就从「造出能动的机器人」转向「谁掌握通用大脑、谁掌握数据」。

二、技术拆解:VLA 与「机器人大脑」的分层架构

把当下的「机器人大脑」拆开,是一条从感知到执行的四层链路:感知层已经被多模态大模型解决得差不多,真正的分水岭在世界模型层、VLA 策略层和控制层。

上图:具身智能「大脑」的四层技术栈——感知、世界模型、VLA 策略、控制层逐层解耦,数据与仿真成为训练燃料

世界模型(NVIDIA Cosmos、DeepMind Genie、Genesis 引擎)是 2026 年最热的技术路线,本质是「物理世界的生成模型」,价值不只是推理,而是当训练数据工厂。VLA 是「大脑」的核心,把多模态输入直接映射为动作序列。2026 年的主流实现已经从「一个网络包打天下」走向多层解耦:Google 把推理(ER 2)、运动控制(VLA)、端侧执行(On-Device 2)拆成三个模型;Figure 的 Helix 02 在 7B VLM 之下加了 80M 的运动策略层和 10M 的全身动力学层(1kHz),直接替换掉约 10 万行手写 C++ 控制代码。[A]

Gemini Robotics 2 的真机实测比发布会更说明问题:Apollo 2 拾取桌面 68.4%、地面 45.7%、货架 76.3%;ER 2 的 key-moment 定位 91.3%。[A]

两个硬瓶颈:控制频率与数据稀缺

原生 VLA 端到端推理只有约 3-5Hz,而流畅操作需要 50-100Hz,差 10-20 倍。整个边缘推理赛道(EdgeVLA-Tiny、Embodied.cpp、Jetson-PI)都在解决这一个问题。[A] 数据侧,语言模型有整个互联网,机器人只有稀缺的物理交互数据。数据效率的进步快得惊人:FLUX-mimic 用 30 分钟机器人数据把软体装配做到 95% 成功率(对比 π0.5 的 55%);π0.7 零样本跨本体折叠衣物达 85.6%。[A]

上图:具身智能的数据飞轮——仿真与合成数据缓解真实数据稀缺,sim-to-real 闭环是能否规模部署的关键

但短板依然清晰。Gemini Robotics 2 的实测里,多指拧出灯泡 92%,旋进去只有 36%;垃圾袋打结 44%。粗放操作已经接近可用,精细灵巧操作还差得远——这决定了当下落地集中在结构化工业产线,而不是开放家庭环境。[A]

三、竞争格局:大脑、身体与「神经系统」的三方战争

把玩家按「大脑—身体—神经系统」三条线切开,格局立刻清晰。需要先点破:2026 年估值最高的不是纯大脑公司,而是垂直整合和已经产生收入的公司——Figure 估值约 390 亿美元,Agility 靠 RaaS 拿到真金白银上市,反而 Physical Intelligence 的 110 亿美元显得保守。[B]

玩家战场核心资产2026 年状态
Google DeepMind大脑Gemini Robotics 2 三模型跨本体验证,「给每个机器人的智能层」
NVIDIA神经系统Cosmos + Isaac Lab + GR00T + Jetson全栈平台 + 广撒网投资
Physical Intelligence大脑π0.5/π0.7 开源 VLAC 轮洽谈约 110 亿美元
Figure身体+大脑Helix 02、Figure 03估值约 390 亿美元,BMW KPI 亮眼
Tesla身体+大脑+数据Optimus Gen 3千台部署但「零有用工作」
Agility身体+RaaSDigit v5唯一有验证收入的人形公司
中国阵营身体+供应链宇树/智元/优必选/傅利叶H1 2026 出货占全球约 97%

上图:2025-2026 具身智能从单点 demo 走向平台化叙事的里程碑时间线

平台化有三条路径。一是 Google 的「大脑平台」:自己不做硬件,把 Gemini Robotics 授权给本体厂商——这是安卓模式的重演。[B] 二是 NVIDIA 的「神经系统平台」:把 Cosmos、Isaac、GR00T、Newton、Jetson Thor 串成工具链,配一个「参考人形机器人」当样板——这是机器人的「CUDA 时刻」打法。[D] 三是垂直整合(Figure、Tesla、1X、智元):大脑+身体+数据全闭环。但这条路有个残酷注脚——Tesla 部署的 1000 多台 Optimus Gen 3 目前「没有一台在做有用工作」,马斯克承认初始产出「极其缓慢」。[B]

融资侧,产业资本开始「锁产能」。Humanoid 的 A 轮里,Bosch 为其代工(5 年最高 10 万台),Schaeffler 签下「已公布最大商业订单」。[B] 中国更激进:单笔 10 亿元成为常态,它石智航 Pre-A 融到 4.55 亿美元,千寻智能三个月四轮累计 45 亿元;约 70% 资金指向未来训练而非当期商业化。[B]

四、采用与生态:从「demo 繁荣」到「真部署」

2026 上半年全球人形机器人出货约 1.91 万台(同比 +272%),但「真正在做有用工作」的只有极少数:Figure 03 在 BMW 南卡工厂完成 9 万+ 零部件、3 万+ 辆 X3、准确率 >99%;Agility Digit 在 GXO 搬了 10 万+ 周转箱,是唯一有验证收入的人形公司;AgiBot 累计 1.5 万台、占 H1 全球出货 44%。[B]

市场预测在互相抬价:高盛把 2035 年 TAM 上调到 380 亿美元(乐观情景 1540 亿),摩根士丹利把中国 2026 年出货预测翻倍到 5 万台。[B] 但 2026 上半年全球出货才 1.91 万台,中国厂商占了约 97%——大量是卖给科研机构和买来展示的。IFR 数据显示传统工业机器人已很成熟(2024 年全球新装机 54.2 万台、中国占 54%),人形只是大盘子里刚冒头的新物种。[A]

开发者生态比硬件更早到来。Hugging Face 的 LeRobot 冲到约 2.6 万星,配套数据集 Hub 有 1.6 万+ 数据集、200 万+ 轨迹;NVIDIA 把 GR00T N1.7(3B 参数,Apache-2.0)开放、推出基于宇树 H2 Plus 的「参考人形机器人」。[A] 但开源数据规模仍远低于 LLM:Open X-Embodiment 约 100 万条轨迹,大模型是万亿 token 级——这就是「数据墙」,软件栈已 ready,数据还没有。

采用还卡在三件事:成本(西方整机约 9-10 万美元,隐藏成本再上 50-100%)、可靠性(工厂要 99.999% 成功率,基础模型目前约 80%)、安全与监管空白。[B] 而经济驱动力正把需求推向临界点:美国 2030 年预计有 210 万个制造业岗位缺口;中国劳动年龄人口持续下滑;黄仁勋那句「每一家工业公司都会变成机器人公司」就是给这轮需求定调。[B]

中国具身智能的 2026 是「政策 + 资本 + 量产」组合拳。具身智能连续两年写进《政府工作报告》,工信部要求年底具备「万台级」规模落地能力;600.6 亿元的国家 AI 产业投资基金首次投向具身智能。[A] 模型侧,千寻智能的 Spirit v1.6 在 RoboArena 登顶(1894 分,首次击败 NVIDIA Cosmos 3 与 π0.5),宇树开源 UnifoLM-VLA-0,华为、阿里、腾讯接连发布具身基座模型。[B] 但泡沫信号同样刺眼:「大脑派」公司出货普遍不到 1000 台,多数创业公司现金跑道只有 18-24 个月——2026 被行业称为「淘汰赛元年」。[B]

五、战略含义:「安卓时刻」之后的赢家逻辑

如果「大脑平台化」成立,行业会沿一条清晰的传导链变化:

上图:具身智能「安卓时刻」的传导链——大脑平台化 → 硬件标准化 → 数据与生态成为新护城河

第一,硬件会走向标准化和廉价化,本体厂商的差异化转向成本与可靠性。第二,数据会成为真正的护城河——谁的机器人先规模化部署,谁拿到最多的真实物理交互数据,谁的大脑就更强。第三,工具链和开发者生态决定长跑,NVIDIA 正在做机器人的「CUDA 时刻」。[D]

中美在具身智能的差异,比语言模型清晰得多:

维度中国美国
大脑(模型)快速追赶,RoboArena 登顶领先,工具链完整
芯片/算力昇腾 910C 约占训练集群 23%主导,但 H20 出口受限
供应链执行器全球份额约 26%(美国约 5%)、稀土约 60%本地化率不足 50%
量产2025 全球人形出货 84%+ 来自中国Figure/Agility/Tesla 各约 150 台

中国能把整机成本压到西方的三分之一以下,量产规模全球领先;美国握有工具链、前沿模型和资本定价权。这不是语言模型那种「开源渗透」,而是半导体式的「产业链分工 + 局部卡位」。[D]

六、我的评估

先下结论:具身智能的「安卓时刻」确实在发生,但它比手机更慢、更贵、更依赖物理世界。 大脑与身体解耦是大方向,可解耦深度远没有宣传中那么深——今天最先进的 VLA 仍需针对本体适配,距离「一套大脑跑所有机器人」还有相当距离。

我判断未来 12 个月有三个观察点。第一,灵巧操作能不能突破「最后几厘米」——旋入灯泡这类技能实现量产级稳定,家庭场景才会真正打开。第二,NVIDIA 的开发者生态能不能锁定——如果 GR00T/Isaac 成为默认栈,「具身智能的 CUDA 时刻」会先于任何单一机器人公司变现。第三,中国能不能在「大脑」层追上——语言模型的路径在具身智能上未必成立,因为数据不是开源的,是长在工厂和车间里的。

我原以为具身智能 2026 年会继续停留在「demo 繁荣」:融资热、发布会热、真部署少。研究完这个窗口期我修正了判断——Audi 产线测试、Humanoid 的 Q4 部署计划、935 亿融资盘子,说明它已经开始从 demo 走向第一批规模化试点。被打脸的风险同样存在:如果灵巧操作 12 个月没有实质突破,如果「通用大脑」最终只是「每个本体各训一遍」的伪平台化,这轮 935 亿投资会先经历一轮残酷出清。

先不下结论的只有一个问题:当「大脑」真的平台化了,价值会沉淀在模型层(Google/Physical Intelligence)、数据层(Tesla/工厂)还是工具链层(NVIDIA)?答案可能要到 2027 年才清晰——但方向已经摆在那里了。


参考来源

  1. Google DeepMind — Gemini Robotics 2 brings whole body intelligence to robots
  2. 36氪 — 谷歌机器人整了波大活儿,要攻克「最后几厘米」
  3. 36Kr — 2026 H1 具身智能融资 935 亿元 / 322 笔
  4. Bloomberg — Robotics startup Genesis in talks to raise ~$500M
  1. TNW — Genesis AI in talks to raise ~$500M for robot brains
  2. TechCrunch — Nvidia wants to be the Android of generalist robotics
  3. Goldman Sachs — The global market for robots could reach $38B by 2035
  4. BMW Group — Figure 03 project in Spartanburg

AI 辅助深度研究,人工视角解读。 每日更新。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐