当机器人跑得比人快、后空翻比体操运动员还稳,所有人都开始问:属于具身智能的“iPhone时刻”是不是已经来了?

答案可能比想象中更冷静——我们还在大哥大时代,而且连通信制式都还没统一。

2026年,具身智能的热度达到了新的沸点。马斯克说“擎天柱”明年就要规模化量产,春晚上的机器人方阵让全国观众惊叹,马拉松赛道上的人形机器人跑出了令人咋舌的成绩。公众的兴奋是真实的,资本的押注是巨大的,整个行业看起来似乎正处于爆发的前夜。

然而,在一场腾讯研究院组织的闭门圆桌上,多位来自产业、高校和创业一线的专家给出了一个高度一致的判断:“iPhone时刻”远未到来。

如果非要给当下的具身智能找一个历史坐标,它更像是手机产业的上古时期——大哥大时代。功能有了,但笨重、昂贵、不稳定,最关键的是,通往未来的技术路线还远没有收敛。

这篇文章,我想把这次深度对话中最值得关注的几个核心洞察拆解出来,并加上我的一些思考。这些来自一线的冷静声音,恰恰是这个喧嚣时刻最稀缺的东西。

---

一、“能动”和“能用”之间,横亘着一道数据鸿沟

要理解具身智能的真实处境,必须先做一个区分:小脑和大脑。

所谓小脑,指的是机器人的运动控制能力——走路、跑步、跳跃、后空翻。这块能力在过去两年取得了肉眼可见的飞跃。从机器人马拉松到各家企业的舞台秀,从业者达成的共识是:“能不能动”的问题,基本上已经解决了。

但问题出在“大脑”。

大脑负责的是决策、理解和泛化——看到一扇没见过的门知道怎么开,进入一个陌生的厨房知道怎么操作,遇到从未训练过的场景能够自主判断该做什么。这才是“能用”的核心,也是当前最大的瓶颈。

用大模型的发展历程来类比,在场嘉宾给出了一个令人清醒的判断:具身智能的“大脑”甚至连GPT-2.0时刻都还没到。

为什么?因为GPT-2.0虽然粗糙,但至少技术路线是明确的——Transformer架构、海量互联网文本数据、自监督预训练,大家都在往同一个方向用力。而具身智能呢?VLA(视觉-语言-动作)模型去年还被视为共识方向,今年已经有大量团队转向世界模型等其他路径。整个行业连下一步该怎么走都还没达成一致。

这还不是最棘手的问题。最棘手的是数据。

---

二、200倍的差距:数据才是真正的瓶颈

圆桌讨论中,一个数字被反复提及,我认为它是理解当前具身智能困局最直观的标尺——

业界普遍认为,具身智能要实现类似GPT-2.0或GPT-2.5级别的突破,至少需要千万条级的高质量数据。然而,目前全球所有机构加在一起,拥有的具身智能数据大约只有50万条。

差了多少?整整200倍。

这不是一个通过“砸钱”就能快速填平的差距。因为具身智能的数据和语言大模型的数据,本质上不是一个物种。

GPT系列的训练数据来自互联网——文本、代码、网页,这些都是天然数字化、天然可获取的。你只需要爬取、清洗、投喂。但具身智能需要的是物理世界交互数据:机器臂抓取不同材质物体的力度反馈、双足在不同地面上行走的平衡调节、开门时钥匙与锁孔的接触力学……这些数据无法从互联网获得,必须通过真实机器人执行或高精度遥操作采集。

这就带来了一个成本问题。采集一条高质量的遥操作数据,需要专业的设备、专业的操作员、标准化的环境,成本高昂。一位嘉宾提到,即使乐观估计,要让机器人达到类似自动驾驶L3/L4的水平,可能需要数千亿小时的数据量——而我们现在手上有多少?几百万小时。

这个鸿沟面前,所有关于“iPhone时刻已经到来”的论断都显得过于乐观。

---

三、经济账算不过来,这才是商业化第一道真正的门槛

技术不成熟不代表不能商业化,很多技术都是在应用中逐步迭代的。但具身智能面临一个更现实的拷问:经济账算得过来吗?

一位年轻的00后创业者在圆桌上提了一个很尖锐的问题:机器人进工厂替代工人,看起来是很自然的需求,但一旦开始算账,事情就尴尬了。

一个具备基本劳动能力的人形机器人,硬件成本加上VLA模型或世界模型的部署成本,综合下来往往比雇佣一个工人更贵,而且要贵不少。关键是,贵也就算了,它还不够稳定——工厂追求的是极致的效率和成功率,而当前的具身智能还远达不到那种可靠性。

这就造成了一个荒诞的局面,正如圆桌中一位嘉宾调侃的那样:“我们在让机器人做我们擅长做的事,而不是替我们做不想做的事。” 我们想让机器人去炒菜、做家务,实际上却是我们在做家务,机器人在写诗画画。

这才是商业化面临的第一道真正门槛:不是“能不能做”,而是“划不划算”。

---

四、三层市场的渐进路径:从情绪价值到生产力革命

那么,具身智能短期内到底应该往哪里走?圆桌讨论给出了一个非常务实的分析框架,把市场分成了三个层次。

第一层:百亿级的情绪价值市场。

这是最现实、最接近爆发的一个市场。表演展示、陪伴养成、情感交互——用户愿意为“被陪伴”买单,而且对价格的敏感度相对较低。正如一位嘉宾所说,国内泡泡玛特能做到万亿市值,靠的就是给年轻人提供情绪价值。一个机器人,哪怕什么活都不干,就是坐在那里陪你说说话、给你一个拥抱,这本身就是巨大的市场。

而且这个市场的妙处在于,它不需要解决“泛化劳动操作”这类最难的技术问题,运动控制加多模态交互就基本够用了。它能让产业链先跑起来,让用户认知先建立起来,给技术成熟争取时间。

第二层:千亿级的商业服务市场。

这是功能价值和情绪价值的交汇点。导览、导购、导办——在这些半结构化场景中,机器人既可以替代一部分人力,又能提供人类服务人员不具备的新奇体验。这个市场对能力的要求更高一些,需要运动控制、自主导航和多模态交互的综合能力,但相较于“进工厂打工”,环境相对可控。

第三层:百万亿级的劳动操作市场。

这才是终极目标——广泛替代人类进行体力劳动。进工厂、做家务、护理老人,所有那些“人不愿意做、不想做”的事情交给机器人。这个市场有多大?一个直观的估算是,如果未来十亿级的机器人保有量,乘以新能源车级别的单价(十万人民币),就是百万亿级别。

但这也是最遥远的一个市场。因为它要求的不只是“能动”,而是“能理解、能泛化、能稳定操作”,而且成本必须降到比人工更便宜。这条路上的每一个关卡,现在都还没有打通。

---

五、一个被低估的风险:AI的“欺骗性”与认知替代

圆桌最后讨论了一个很有意思的话题:“用AI造AI”。这似乎是技术进步的自然方向——用世界模型生成训练数据、用大模型驱动研发流程。但几位嘉宾都表达了一个共同的警惕:

AI有欺骗性,而且这种欺骗性非常隐蔽。

它生成的内容看起来合理、流畅、自信,但可能是错的。在具身智能的研发中,如果过度依赖AI生成的合成数据来做关键决策,可能会把整个系统引向错误的方向。

更大的风险在于“认知替代”。一位高校教授分享了她观察到的现象:学生们越来越习惯直接把问题丢给AI,拿到答案就交上去,中间的理解和思考过程被完全跳过。“工具的先进性带来人的懒惰”,这句话放在科研和工程领域可能后果更严重——因为具身智能要解决的都是没有现成答案的问题,依赖AI给出的“通识性”回答根本无法突破技术瓶颈。

这也是为什么,几位嘉宾一致认为:关键决策不能交给AI,核心判断必须由人掌握。 AI是提升效率的工具,但工具永远不能替代思考的主体。

---

六、写在最后:认清坐标,才能走得更远

读完这场圆桌的实录,我最大的感受是:当下具身智能行业最稀缺的不是资本,不是人才,而是准确的历史坐标感。

在媒体的叙事里,具身智能似乎每个季度都在发生“突破性进展”;在社交网络上,机器人跳舞的视频总是能收割海量点赞。这些当然是行业发展的重要组成部分——它们吸引关注、吸引人才、吸引资源。但如果从业者自己都相信了“iPhone时刻已到”的叙事,把资源过早地投入到不切实际的应用场景中,很可能会走很长的弯路。

具身智能的终局是确定的:人工智能一定会走出屏幕,进入物理世界,走进千家万户。 这个判断,在场的所有人没有任何分歧。

但路径是漫长的。数据要从50万爬到千万级,模型路线要从发散走向收敛,成本要从“比人贵”降到“比人便宜”,稳定性要从“能演示”进化到“能可靠运行”——每一条线都需要时间,没有任何捷径。

在这样一个时间节点上,最清醒的姿态也许是:对这个行业抱有最大的信心,但同时保持最冷静的耐心。

知道自己在“大哥大时代”并不可怕,可怕的是以为自己已经在“iPhone时代”,然后做了错误的决定。

路漫漫其修远兮。

---

本文基于腾讯研究院2026年7月“具身智能的iPhone时刻要来了吗”圆桌讨论的内容进行深度分析和延伸思考。文中核心数据和观点来自与会专家,分析部分由作者独立完成。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐