深度 | 具身智能的「安卓时刻」:机器人大脑平台化,硬件正在沦为躯壳 — 深度分析
具身智能的「安卓时刻」:机器人大脑平台化,硬件正在沦为躯壳 — 深度分析
这是一篇深度研究,不是新闻简报。基于 30+ 个来源的交叉验证。 证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断
核心观点: 2026 年具身智能的「大脑」正与「身体」解耦——VLA 跨本体泛化、硬件走向标准化,竞争从「造机器人」转向「谁掌握通用大脑、谁掌握喂给大脑的数据」;中国以约 935 亿元融资和量产规模入场,但 2026 也是「淘汰赛元年」。

一、一个反直觉的信号:大脑开始和身体「离婚」
2026 年 7 月最后一周,三个信号指向同一件事。7 月 30 日 Google DeepMind 发布 Gemini Robotics 2——三模型组成的「机器人大脑」:能让人形机器人「从脚到指尖」全身控制的 VLA、负责高层推理的 ER 2、只需不到 200 个样本就能适配新本体的端侧模型。[A] 英国 Humanoid 完成 1.52 亿美元 A 轮,Schaeffler、Bosch 以产业资本入场;Black Forest Labs 的 FLUX-mimic 把机器人微调时间从 30 多小时压到 30 分钟,正在奥迪工厂测试。[B] 国内,2026 上半年中国具身智能融资约 935 亿元、322 笔,是去年同期的约 5 倍。[B]
三个信号合起来指向一个结构变化:机器人的「大脑」正在与「身体」解耦。模型不再绑定具体硬件,而是像手机操作系统一样试图跨本体通用——硬件则越来越像标准化躯壳。这是具身智能的「安卓时刻」:当大脑变成平台,主战场就从「造出能动的机器人」转向「谁掌握通用大脑、谁掌握数据」。
二、技术拆解:VLA 与「机器人大脑」的分层架构
把当下的「机器人大脑」拆开,是一条从感知到执行的四层链路:感知层已经被多模态大模型解决得差不多,真正的分水岭在世界模型层、VLA 策略层和控制层。

上图:具身智能「大脑」的四层技术栈——感知、世界模型、VLA 策略、控制层逐层解耦,数据与仿真成为训练燃料
世界模型(NVIDIA Cosmos、DeepMind Genie、Genesis 引擎)是 2026 年最热的技术路线,本质是「物理世界的生成模型」,价值不只是推理,而是当训练数据工厂。VLA 是「大脑」的核心,把多模态输入直接映射为动作序列。2026 年的主流实现已经从「一个网络包打天下」走向多层解耦:Google 把推理(ER 2)、运动控制(VLA)、端侧执行(On-Device 2)拆成三个模型;Figure 的 Helix 02 在 7B VLM 之下加了 80M 的运动策略层和 10M 的全身动力学层(1kHz),直接替换掉约 10 万行手写 C++ 控制代码。[A]
Gemini Robotics 2 的真机实测比发布会更说明问题:Apollo 2 拾取桌面 68.4%、地面 45.7%、货架 76.3%;ER 2 的 key-moment 定位 91.3%。[A]
两个硬瓶颈:控制频率与数据稀缺
原生 VLA 端到端推理只有约 3-5Hz,而流畅操作需要 50-100Hz,差 10-20 倍。整个边缘推理赛道(EdgeVLA-Tiny、Embodied.cpp、Jetson-PI)都在解决这一个问题。[A] 数据侧,语言模型有整个互联网,机器人只有稀缺的物理交互数据。数据效率的进步快得惊人:FLUX-mimic 用 30 分钟机器人数据把软体装配做到 95% 成功率(对比 π0.5 的 55%);π0.7 零样本跨本体折叠衣物达 85.6%。[A]

上图:具身智能的数据飞轮——仿真与合成数据缓解真实数据稀缺,sim-to-real 闭环是能否规模部署的关键
但短板依然清晰。Gemini Robotics 2 的实测里,多指拧出灯泡 92%,旋进去只有 36%;垃圾袋打结 44%。粗放操作已经接近可用,精细灵巧操作还差得远——这决定了当下落地集中在结构化工业产线,而不是开放家庭环境。[A]
三、竞争格局:大脑、身体与「神经系统」的三方战争
把玩家按「大脑—身体—神经系统」三条线切开,格局立刻清晰。需要先点破:2026 年估值最高的不是纯大脑公司,而是垂直整合和已经产生收入的公司——Figure 估值约 390 亿美元,Agility 靠 RaaS 拿到真金白银上市,反而 Physical Intelligence 的 110 亿美元显得保守。[B]
| 玩家 | 战场 | 核心资产 | 2026 年状态 |
|---|---|---|---|
| Google DeepMind | 大脑 | Gemini Robotics 2 三模型 | 跨本体验证,「给每个机器人的智能层」 |
| NVIDIA | 神经系统 | Cosmos + Isaac Lab + GR00T + Jetson | 全栈平台 + 广撒网投资 |
| Physical Intelligence | 大脑 | π0.5/π0.7 开源 VLA | C 轮洽谈约 110 亿美元 |
| Figure | 身体+大脑 | Helix 02、Figure 03 | 估值约 390 亿美元,BMW KPI 亮眼 |
| Tesla | 身体+大脑+数据 | Optimus Gen 3 | 千台部署但「零有用工作」 |
| Agility | 身体+RaaS | Digit v5 | 唯一有验证收入的人形公司 |
| 中国阵营 | 身体+供应链 | 宇树/智元/优必选/傅利叶 | H1 2026 出货占全球约 97% |

上图:2025-2026 具身智能从单点 demo 走向平台化叙事的里程碑时间线
平台化有三条路径。一是 Google 的「大脑平台」:自己不做硬件,把 Gemini Robotics 授权给本体厂商——这是安卓模式的重演。[B] 二是 NVIDIA 的「神经系统平台」:把 Cosmos、Isaac、GR00T、Newton、Jetson Thor 串成工具链,配一个「参考人形机器人」当样板——这是机器人的「CUDA 时刻」打法。[D] 三是垂直整合(Figure、Tesla、1X、智元):大脑+身体+数据全闭环。但这条路有个残酷注脚——Tesla 部署的 1000 多台 Optimus Gen 3 目前「没有一台在做有用工作」,马斯克承认初始产出「极其缓慢」。[B]
融资侧,产业资本开始「锁产能」。Humanoid 的 A 轮里,Bosch 为其代工(5 年最高 10 万台),Schaeffler 签下「已公布最大商业订单」。[B] 中国更激进:单笔 10 亿元成为常态,它石智航 Pre-A 融到 4.55 亿美元,千寻智能三个月四轮累计 45 亿元;约 70% 资金指向未来训练而非当期商业化。[B]
四、采用与生态:从「demo 繁荣」到「真部署」
2026 上半年全球人形机器人出货约 1.91 万台(同比 +272%),但「真正在做有用工作」的只有极少数:Figure 03 在 BMW 南卡工厂完成 9 万+ 零部件、3 万+ 辆 X3、准确率 >99%;Agility Digit 在 GXO 搬了 10 万+ 周转箱,是唯一有验证收入的人形公司;AgiBot 累计 1.5 万台、占 H1 全球出货 44%。[B]
市场预测在互相抬价:高盛把 2035 年 TAM 上调到 380 亿美元(乐观情景 1540 亿),摩根士丹利把中国 2026 年出货预测翻倍到 5 万台。[B] 但 2026 上半年全球出货才 1.91 万台,中国厂商占了约 97%——大量是卖给科研机构和买来展示的。IFR 数据显示传统工业机器人已很成熟(2024 年全球新装机 54.2 万台、中国占 54%),人形只是大盘子里刚冒头的新物种。[A]
开发者生态比硬件更早到来。Hugging Face 的 LeRobot 冲到约 2.6 万星,配套数据集 Hub 有 1.6 万+ 数据集、200 万+ 轨迹;NVIDIA 把 GR00T N1.7(3B 参数,Apache-2.0)开放、推出基于宇树 H2 Plus 的「参考人形机器人」。[A] 但开源数据规模仍远低于 LLM:Open X-Embodiment 约 100 万条轨迹,大模型是万亿 token 级——这就是「数据墙」,软件栈已 ready,数据还没有。
采用还卡在三件事:成本(西方整机约 9-10 万美元,隐藏成本再上 50-100%)、可靠性(工厂要 99.999% 成功率,基础模型目前约 80%)、安全与监管空白。[B] 而经济驱动力正把需求推向临界点:美国 2030 年预计有 210 万个制造业岗位缺口;中国劳动年龄人口持续下滑;黄仁勋那句「每一家工业公司都会变成机器人公司」就是给这轮需求定调。[B]
中国具身智能的 2026 是「政策 + 资本 + 量产」组合拳。具身智能连续两年写进《政府工作报告》,工信部要求年底具备「万台级」规模落地能力;600.6 亿元的国家 AI 产业投资基金首次投向具身智能。[A] 模型侧,千寻智能的 Spirit v1.6 在 RoboArena 登顶(1894 分,首次击败 NVIDIA Cosmos 3 与 π0.5),宇树开源 UnifoLM-VLA-0,华为、阿里、腾讯接连发布具身基座模型。[B] 但泡沫信号同样刺眼:「大脑派」公司出货普遍不到 1000 台,多数创业公司现金跑道只有 18-24 个月——2026 被行业称为「淘汰赛元年」。[B]
五、战略含义:「安卓时刻」之后的赢家逻辑
如果「大脑平台化」成立,行业会沿一条清晰的传导链变化:

上图:具身智能「安卓时刻」的传导链——大脑平台化 → 硬件标准化 → 数据与生态成为新护城河
第一,硬件会走向标准化和廉价化,本体厂商的差异化转向成本与可靠性。第二,数据会成为真正的护城河——谁的机器人先规模化部署,谁拿到最多的真实物理交互数据,谁的大脑就更强。第三,工具链和开发者生态决定长跑,NVIDIA 正在做机器人的「CUDA 时刻」。[D]
中美在具身智能的差异,比语言模型清晰得多:
| 维度 | 中国 | 美国 |
|---|---|---|
| 大脑(模型) | 快速追赶,RoboArena 登顶 | 领先,工具链完整 |
| 芯片/算力 | 昇腾 910C 约占训练集群 23% | 主导,但 H20 出口受限 |
| 供应链 | 执行器全球份额约 26%(美国约 5%)、稀土约 60% | 本地化率不足 50% |
| 量产 | 2025 全球人形出货 84%+ 来自中国 | Figure/Agility/Tesla 各约 150 台 |
中国能把整机成本压到西方的三分之一以下,量产规模全球领先;美国握有工具链、前沿模型和资本定价权。这不是语言模型那种「开源渗透」,而是半导体式的「产业链分工 + 局部卡位」。[D]
六、我的评估
先下结论:具身智能的「安卓时刻」确实在发生,但它比手机更慢、更贵、更依赖物理世界。 大脑与身体解耦是大方向,可解耦深度远没有宣传中那么深——今天最先进的 VLA 仍需针对本体适配,距离「一套大脑跑所有机器人」还有相当距离。
我判断未来 12 个月有三个观察点。第一,灵巧操作能不能突破「最后几厘米」——旋入灯泡这类技能实现量产级稳定,家庭场景才会真正打开。第二,NVIDIA 的开发者生态能不能锁定——如果 GR00T/Isaac 成为默认栈,「具身智能的 CUDA 时刻」会先于任何单一机器人公司变现。第三,中国能不能在「大脑」层追上——语言模型的路径在具身智能上未必成立,因为数据不是开源的,是长在工厂和车间里的。
我原以为具身智能 2026 年会继续停留在「demo 繁荣」:融资热、发布会热、真部署少。研究完这个窗口期我修正了判断——Audi 产线测试、Humanoid 的 Q4 部署计划、935 亿融资盘子,说明它已经开始从 demo 走向第一批规模化试点。被打脸的风险同样存在:如果灵巧操作 12 个月没有实质突破,如果「通用大脑」最终只是「每个本体各训一遍」的伪平台化,这轮 935 亿投资会先经历一轮残酷出清。
先不下结论的只有一个问题:当「大脑」真的平台化了,价值会沉淀在模型层(Google/Physical Intelligence)、数据层(Tesla/工厂)还是工具链层(NVIDIA)?答案可能要到 2027 年才清晰——但方向已经摆在那里了。
参考来源
AI 辅助深度研究,人工视角解读。 每日更新。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)