泛 AI 科技 · 原创干货

我们聊了很多大模型,但它们一直待在屏幕里——你打字、它出字。可人对世界的绝大多数交互,不是靠打字,是靠身体:走、抓、看、平衡、在乱糟糟的真实环境里做决定。让 AI 拥有一个身体、能在物理世界里行动,这事叫具身智能(embodied AI)。

它可能是比"再大一点"的模型更硬的一场仗,也是 AI 真正走进现实生活的那道门。

屏幕里的 AI 和"有身体"的 AI

纯软件 AI 的难点,大多落在"符号世界":文字、代码、逻辑。可一旦要让机器去厨房端杯水、去仓库搬箱子、去病房递药,难度维度整个变了。真实世界不规整:光线会变、物体会滑、地面会不平、意外随时来。这些恰恰是符号 AI 最怕的。

具身智能的赌注是:智能不是凭空想出来的,是在和身体、和环境的交互里"长"出来的。婴儿不是先读完物理课本才学会走路,是摔着摔着懂的。这个思路下,让 AI 有个身体去碰世界,它可能才真正"理解"世界。

机器人是它最直观的壳

说到具身,大家最先想到机器人。这两年确实热闹:人形机器人能走能抓、能模仿人类动作;四足机器人在复杂地形里跑得稳;仓储里分拣、工厂里装配的机器臂越来越灵。

背后的推力有两个。一是大模型给了机器人"脑子"——过去机器人靠工程师写死每种动作,现在可以用自然语言下指令,让模型现场拆解"去把那个红的拿过来"成一系列动作。二是硬件和传感便宜了、好了,让"身体"没那么贵那么脆。

它难在哪,为什么慢

别被演示视频骗了。视频里机器人优雅端咖啡,现实里它可能在稍微挪个桌子的场景就傻眼。具身智能的硬骨头:

泛化弱。在训练环境里练得再好,换个没见过的布局就懵。人类随手适应的乱境,对机器是地狱。

安全和可靠。屏幕里的 AI 答错,顶多误导;机器人执行错,可能撞人或砸东西。容错要求天差地别,所以落地格外谨慎。

数据稀缺。软件 AI 有互联网海量文本可学;机器人的"身体经验"得真机去碰、去采集,贵且慢,数据少得多。

实时性。机器人得在毫秒级对环境反应,不能像聊天那样慢慢想。这又卡算力和延迟。

会先落在哪

与其等"全能人形保姆",不如看那些"环境受控、任务清晰"的地方先跑通:工厂装配、仓储分拣、农业采摘、巡检排险——这些场景边界清楚、容错空间相对大,最容易兑现价值。医疗康复、老龄化照护是更远的想象,但需求真实。

值得注意,具身不只有机器人。自动驾驶本质是"具身"的一种——车是个有身体的 AI,在真实路况里感知决策。无人机、智能家居里的移动设备,都算这个谱系。所以具身智能不是某个产品,是一类"AI 落地物理世界"的统称。

普通人现在能碰到什么,三年后会怎样

现在你能间接感受的:扫地机器人越障更聪明、仓储自动化让快递更快、工厂柔性产线让小批量定制变可能。直接摸到的具身产品还少,但四足巡检机、商服接待机器人已经在特定场所上岗。

往后三年,更现实的预期不是"家家有个机器人管家",而是"机器人在受控场景里更能干":仓储和工厂渗透率继续涨,巡检、农业、危险作业替代加速,人形机器人先在展示和简单任务里试水。真正进家庭,还得等成本、安全、泛化三关一起过——那比演示视频暗示的慢得多。

所以别被"机器人统治世界"的标题带节奏。具身智能的真实剧本是:先在人类不想干、危险、重复的体力活里悄悄替换,再慢慢往复杂场景爬。它不性感,但扎实。

大模型让 AI 学会了"想",具身智能要它学会"做"。想的突破已经炸裂,做的突破才刚起步。这场仗更难、更慢、也更值得盯——因为真正改变日常生活的,往往不是那个最会聊天的,而是那个能帮你把杯子从桌上拿过来的。

给个冷静的预期管理:具身智能的热度远高于它的成熟度。资本和媒体爱讲"机器人元年",但落地曲线从来比标题慢。未来三五年,更可能看到的是"在特定场景悄悄变能干",而不是"走进每家每户"。对个人,与其焦虑被替代,不如想清楚:你的工作里,哪些"脏、累、险、重复"的体力或操作环节,最可能被有身体的 AI 接走?

提前想明白,才能接得住这波变化,而不是等它撞上门才慌。看清节奏,比追热点有用。

所以看待具身智能,少看发布会,多看落地场景。它不会一夜之间走进客厅,但会在仓库工厂田间悄悄替换重复劳动。这种变化不喧哗却更结实。盯住它,比追概念有用。对普通人,真正的功课是提前想清楚自己的活里哪块最可能被接走,好早做打算,而不是等机器真站到面前才慌。看清趋势的人,总比被趋势撞上的人从容。

未来的竞争,不是人和机器,而是用机器的人和不用机器的人。

— 全文完 —

作者:御风AI,专注AI工具探索

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐