具身智能

一句话掌握:具身智能(EAI,Embodied Artificial Intelligence)=「能思考、能感知、能行动」的智能系统,让智能从「会说话」走向「会做事」;

目录

对无人机从业者而言,做无人机的人本就在做具身智能的「本体侧」,其演进方向是把「会飞的相机」升级为「空中作业智能体」。

适用人群与前置

面向希望理解「无人机行业与具身智能如何衔接」的从业者(研发、测试、工程师)。


一、概念与应用

1. 具身智能(Embodied AI)概念与核心特征

具身智能(Embodied AI)是人工智能(AI)与机器人学交叉的前沿领域。
概念最早可追溯到 1950 年图灵提出的设想——智能必须拥有一个物理实体(「身体」),并通过它与环境实时互动、感知和学习。
2025 年「具身智能」首次被写入《政府工作报告》,标志着其上升为国家级战略方向。

具身 vs 离身(流程链)

离身智能:纯软件、无物理实体(ChatGPT、AI 绘画),处理数字信息 ←→ 具身智能:有物理身体、与物理世界实时互动,智能来源是「感知 → 决策 → 行动 → 再感知」闭环

类比:离身智能像「博学的军师」,具身智能像「文武双全的将军」。

四大核心要素

要素说明
本体物理载体(身体)
智能体具身于本体之上的「大脑」
数据也是实现泛化的关键
学习进化框架强化学习、模仿学习

技术架构三分

层职责
大脑认知与决策,含 VLA 模型
小脑运动控制
本体物理执行,含机械结构、传感器、执行器、驱动与能源、通信系统

注:脑 / 小脑「二分法」正在被端到端架构重构,理解时不要把它当作固定的工程分层,而应视为一种便于理解的逻辑划分。

概念辨析(极易混淆)——范畴依次包含、从大到小:

人工智能 ⊃ 具身智能 ⊃ 智能机器人 ⊃ 人形机器人

具身智能是一种「思想 / 理念」,智能机器人是它最主要的应用载体。并非所有 AI 都是具身(如纯语言模型),也并非所有机器人都是人形。

具身智能的「身体」可以七十二变:机械手臂、数控机床、四足机器狗、六翼无人机、轮式机器人、人形机器人都算。

2. 无人机与具身智能的关系:从「会飞的相机」到空中作业智能体

对照:无人机天然具备具身智能的本体要素

子系统无人机的对应
传感器视觉、IMU、GNSS、激光雷达、毫米波雷达
执行器电机、舵机、云台
驱动与能源锂电池、BMS(电池管理系统)
通信系统数传、WiFi、蜂窝

关键判断:做无人机的人本来就在做具身智能的本体侧。

范式跃迁:从「会飞的相机」(人眼的延伸,采集并回传数据,发现问题解决仍靠人)到「空中作业智能体」(感知—决策—控制—执行—学习完整闭环,理解物理环境、自主完成实操)。

飞行智能体三层技术底座

层说明
感知层多源传感器构建三维地图并具备语义理解;厘米级地图;GPS 失效环境下自主导航成功率 >90%
决策层端侧大模型作机载大脑,本地运行不依赖云端;集群「集中学习、分布式运行」
执行层最大难点,飞行与操作融合,关键是「飞稳」与「抓准」的耦合控制解耦

执行层两条路线

  • 外挂式:成熟无人机加装轻量化机械臂;
  • 集成式:操作机构深度融合飞行本体。

五大商业化落地场景

场景内容
电力巡线、带电作业
低空物流打通最后五米
智慧农业喷洒、精细农事
应急救援侦察、现场处置
城市基建维护高空检测 / 维护

产业与政策数据(截至 2025 年底)

  • 低空经济市场规模 1.5 万亿元,预测 2035 年突破 3.5 万亿元;
  • 注册无人机 328.7 万架,全年飞行 4530.29 万小时;
  • 31 省出台配套政策;
  • 落地原则「先载货后载人、先隔离后融合、先远郊后城区」,作业型无人机优先规模化。

当前行业痛点

  • 智能化水平低;
  • 抗干扰能力弱;
  • 多机空中相遇主动避让能力不足;
  • 依赖卫星导航信号。

对应技术方向:卫星拒止条件下的纯视觉导航与 L4-L5 级自主飞行。


二、具身智能关键技术栈:VLA、世界模型与 Sim-to-Real 数据闭环

1. VLA 模型(视觉-语言-动作)

VLA(Vision-Language-Action,视觉-语言-动作)模型:输入图像与自然语言指令,直接输出动作——「看到什么就做什么」。对确定性高的任务学习更快。

2. 世界模型

世界模型(World Model)让智能体具备「预测这么做会发生什么」的推理能力。与 VLA 互补而非替代:

  • VLA 负责直觉式快速反应(类比「系统 1」);
  • 世界模型承担慎思式物理推演(类比「系统 2」)。

2026 主流方向是混合架构:清华陈建宇团队与斯坦福 Chelsea Finn 团队联合提出 VLAW 框架,首次实现 VLA 策略与动作条件世界模型的协同迭代优化。

3. 数据瓶颈与 Sim-to-Real

数据瓶颈

全球高质量真实物理交互数据仅约 50 万小时,距训练通用具身模型所需的千万小时级,缺口超过 99%。
根因是世界模型学的是传感器与机械臂采集的一手物理数据,采集成本高、标注难。

Sim-to-Real 行业共识

  • 仿真可解决 0 到 90%,最后 10% 的长尾细节仍需真实数据;
  • 规模和多样性比纯度更重要;合成数据是「基础底仓」,真实数据是「校准剂」。

物理一致性门槛

业界最强模型也只能维持几分钟的物理一致性,而普遍认为连续可靠模拟 一小时以上才达到工业可用门槛。

标准进展

2026 年 6 月 1 日,工信部批准的《YD/T 6770—2026 具身智能基准测试方法》正式实施。


三、无人机从业者关注具身智能的重点方向

优先关注的五个方向

方向要点
① 多智能体协同与集群智能编队避让、任务分配、分布式决策、空地协同
② 卫星拒止条件下的自主导航业界指标 GPS 失效下自主导航成功率 >90%;路线:纯视觉导航、视觉惯导融合、SLAM
③ 端侧算力与机载智能决策层本地化的算力支撑
④ 从自动飞行到自主飞行L4-L5 级
⑤ 空中作业与灵巧操作执行层「飞稳」与「抓准」

测试验证层面的重点关注(测试岗最关键)

关注项要点
泛化能力测试固定场景成功率接近 100%,换物品 / 改环境就暴跌;用例必须覆盖「环境微变」与长尾
Sim-to-Real 差距评估量化仿真与实机的性能落差
长时程稳定性物理一致性目前只能维持几分钟,工业门槛 1 小时以上
安全与适航自主系统的安全性、可靠性、适航要求
数据闭环训练数据采集、回流与持续迭代

对测试岗的提示:具身智能测试最易踩的坑是「测试用例只覆盖理想环境」。固定场景跑通不算数,必须覆盖环境微变、光照变化、物品更换等泛化场景(对应本平台「泛化测试」的存量经验),并对「长时程稳定性」「安全适航」做专项验证。

政策与标准

  • 低空经济列入「十五五」战略性新兴产业;
  • 31 省配套政策;
  • 落地三原则:先载货后载人、先隔离后融合、先远郊后城区;
  • 《YD/T 6770—2026 具身智能基准测试方法》。

技术路线收敛风险

VLA 仍是主流,但世界模型、强化学习与 VLA 的融合(VLAW)正在演进,路线尚未收敛,选型要留余地。

行业明确「飞控、机器人、AI、行业知识兼备的复合型人才紧缺」。

与既有知识的衔接

以下既是传统无人机测试的存量,也是具身智能落地的地基,建议在具身智能语境下重读一遍:

  • GNSS 异常;
  • 磁异常;
  • EKF 定位;
  • 多机编队测试校核;
  • ULog 日志分析;
  • 板卡与算力;
  • 失控保护。

四、术语速查

缩写 / 术语中文全称一句话解释
EAI / Embodied AI具身智能能思考、能感知、能行动的智能系统
VLA视觉-语言-动作输入图像 + 语言指令直接输出动作
VLAW视觉-语言-动作-世界VLA 与动作条件世界模型协同的混合框架
World Model世界模型预测「这么做会发生什么」的物理推演
SLAM同步定位与建图同时估计自身位置与构建环境地图
Sim-to-Real仿真到现实迁移用仿真数据训练、用真实数据校准
BMS电池管理系统管理锂电池充放电与安全
IMU惯性测量单元陀螺 + 加速度计组合
GNSS全球导航卫星系统卫星定位导航
YD/T 6770—2026具身智能基准测试方法工信部批准、2026-06-01 实施的测试标准

五、来源与勘误

依据来源:本文基于公开产业报告、政策文件、具身智能行业综述及《YD/T 6770—2026》标准信息整理;涉及具体行业数据的部分沿用原文口径。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐