2026年8月具身智能技术栈全景:从感知到操控的端到端路径
0. 引言
小屌丝:鱼哥,快一个月没更新博客,你这是闭关进修去了?
小鱼:哈哈,算是闭关进修,泡在一堆具身智能最新论文和开源项目里啃资料。
小屌丝:进修也不提前打声招呼,大伙都以为你断更跑路了。
小鱼:门口虚拟 “护法” 都安排上了,沉浸式闭关,谢绝打扰。
小屌丝:…… 你是真能扯,那都是幻觉!咱唠点正经嗑。消失一个月,手是不是都生了?
小鱼:不打紧不打紧,最近行业变化太快,多沉淀一段时间才有干货可以输出。
小屌丝:正好!那咱今天就聊聊当下最火的方向 ——2026 年 8 月最新的具身智能技术栈,这块最近更新迭代简直太快了。
小鱼:说到这个我可来精神了,最近世界模型、VLA、WAM、分层控制路线吵得热火朝天,技术路线都开始内卷了。
小屌丝:对啊,现在早就不是去年简单的 VLM + 动作头那一套了,很多人都说纯 VLA 路线已经摸到天花板。
小鱼:没错,我先梳理下现在主流三条技术路线:第一条传统 VLA(视觉‑语言‑动作);第二条世界模型 World Model;第三条新星 WAM 世界动作模型,三条路线并行赛跑。
小屌丝:那现在主流落地完整技术栈都包含哪些组件?开源这块最近有没有新东西?仿真迁移 Sim‑to‑Real 还是绕不开的痛点吧?
小鱼:你这是面我呢?
小屌丝:嘿嘿,也没有,就是看看你最近的知识储备咋样
小鱼:呦呵?那我们边吃边聊?
小屌丝:非常可以~~

1. 为什么现在谈具身智能技术栈
2026 年,具身智能(Embodied AI)已经从实验室 demo 走向量产前夜。人形机器人、移动操作臂、四足与轮式平台纷纷进入工厂、物流和家庭场景。但“身体”只是载体,真正让机器人在物理世界中自主完成任务的是背后的技术栈。
本文基于 2026 年 8 月最新的开源框架、商业中间件和学术界共识,梳理一套可落地的具身智能技术栈,覆盖感知、建图、规划、控制、仿真与数据闭环。
2. 总体架构
3. 传感器与计算平台
2026 年主流硬件配置:
- RGB-D 相机:Intel RealSense D457 / 奥比中光 Gemini 2XL,提供 720p 深度+RGB 流,全局快门更适合快速运动。
- 激光雷达:Livox Mid-360 / 速腾聚创 Helios 系列,用于大范围 SLAM 和避障。
- 触觉传感器:GelSight Mini / 帕西尼感知 6 维指尖触觉,用于精细操作反馈。
- IMU & 关节编码器:本体标配,提供本体感知。
- 算力平台:
- 端侧:NVIDIA Jetson AGX Orin 64GB(主流),少量使用高通 RB6 或华为昇腾 Atlas 200。
- 云端训练:NVIDIA H100/B200 集群,配合 Lambda Labs 或自建 GPU 云。

4. 感知层
4.1 通用视觉基础模型
- DINOv3:2026 年 Meta 发布的视觉 Transformer,无监督预训练,显著提升开放词汇检测和分割能力。
- SAM 3:Segment Anything Model 第三代,支持视频帧间一致分割,零样本迁移到机器人视角。
- CLIP 变体:OpenCLIP 与 SigLIP 仍广泛用于视觉-语言对齐,但正被更轻量、多模态的模型取代。
4.2 具身专用感知
- 6D 位姿估计:FoundationPose 2.0,支持未见过的物体实时跟踪,结合 NeRF 隐式表示。
- 手部-物体交互理解:DexYCB 2.0 数据集 + HaMeR(Hand Mesh Recovery)模型,实时重建手部姿态与物体相对位姿。
- 多模态融合:基于 Transformer 的早期融合策略,将 RGB、深度、触觉、声音、语言指令统一编码为联合嵌入。
5. 世界模型与语义地图
不再满足于几何地图,世界模型成为具身智能的核心。
- 3D 高斯泼溅(3DGS):2026 年实时 SLAM 标配,以 3D Gaussian Splatting 替代传统点云/网格,实现高保真、可微分的场景重建。
- 语义高斯:每个 3D 高斯球附带语义特征,使用 CLIP/DINO 特征蒸馏,构建可查询的语义地图。
- 神经世界模型:
- UniSim 2.0:Google DeepMind 推出的通用世界模型,可基于视觉输入预测未来状态,用于规划评估。
- 开源方案:IRIS 与 DreamerV4,结合 action-conditioned video prediction 进行内部推演。

6. 任务规划与决策
6.1 大语言模型驱动规划
- LLM-based Planner:以 GPT-5、Gemini 2.5 或开源 Llama 4 为推理核心,将自然语言任务分解为原子技能序列。
- 代码即策略:利用 LLM 生成 Python 代码调用技能库,如 Google 的 Code as Policies 2.0,支持闭环纠错。
- 具身 VLA 模型:
- RT-3:Google 的 Robotics Transformer 第三代,直接输出动作 token,支持多模态指令。
- Octo 2.0:开源通用机器人策略模型,基于扩散策略,可微调适配多种本体。
下面是一个基于 GPT-5 API 的代码即策略实战示例,将自然语言任务分解为可执行的技能序列:
import openai
import json
from typing import List, Dict, Any
# ============================================================
# 1. 技能库定义 —— 机器人可调用的原子技能原语
# ============================================================
SKILL_LIBRARY = {
"move_to": {
"description": "移动基座到指定位置",
"params": ["target_location"],
"example": 'move_to(target_location="kitchen")',
},
"grasp": {
"description": "抓取指定物体",
"params": ["object_name", "grasp_type"],
"example": 'grasp(object_name="apple", grasp_type="power")',
},
"place": {
"description": "将手中物体放置到指定位置",
"params": ["target_location"],
"example": 'place(target_location="table")',
},
"open_door": {
"description": "打开门",
"params": ["door_location"],
"example": 'open_door(door_location="fridge")',
},
"visual_search": {
"description": "通过视觉搜索并定位物体,返回其坐标",
"params": ["object_name"],
"example": 'visual_search(object_name="apple")',
},
"wait": {
"description": "等待指定秒数",
"params": ["seconds"],
"example": "wait(seconds=2)",
},
}
# ============================================================
# 2. GPT-5 API 调用 —— 将自然语言任务分解为技能序列
# ============================================================
def plan_with_gpt5(task_instruction: str, environment_context: str = "") -> List[Dict[str, Any]]:
"""
调用 GPT-5 API,将自然语言指令分解为技能序列。
参数:
task_instruction: 自然语言任务描述
environment_context: 环境上下文(可选),描述当前场景
返回:
技能序列列表,每个元素为 {"skill": 技能名, "params": {...}}
"""
client = openai.OpenAI(api_key="your-api-key") # 实际使用时替换为真实 key
skill_descriptions = "\n".join([
f"- {name}: {info['description']},参数: {info['params']}"
for name, info in SKILL_LIBRARY.items()
])
system_prompt = f"""你是一个机器人任务规划器。你拥有以下技能库:
{skill_descriptions}
请将用户的任务分解为合理的技能调用序列。输出格式必须为严格的 JSON 数组,每个元素包含 "skill" 和 "params" 两个字段。
注意:
- 技能序列必须按执行顺序排列
- 参数必须来自技能库定义的参数名
- 仅使用技能库中存在的技能
- 如果物体的位置未知,应先调用 visual_search 定位"""
response = client.chat.completions.create(
model="gpt-5", # 2026 年 8 月可用模型
messages=[
{"role": "system", "content": system_prompt},
{"role": "user", "content": f"环境上下文:{environment_context}\n\n任务:{task_instruction}"}
],
response_format={"type": "json_object"}, # 强制 JSON 输出
temperature=0.1, # 低温度保证稳定输出
)
plan = json.loads(response.choices[0].message.content)
# 兼容 GPT-5 可能的外层包装
if isinstance(plan, dict) and "plan" in plan:
plan = plan["plan"]
return plan
# ============================================================
# 3. 技能执行器 —— 模拟执行技能序列(实际部署时替换为真实机器人控制)
# ============================================================
def execute_skill(skill_name: str, params: Dict[str, Any]) -> str:
"""
执行单个技能,返回执行结果。
实际部署时,这里会调用机器人底层控制接口。
"""
if skill_name not in SKILL_LIBRARY:
return f"❌ 未知技能: {skill_name}"
# 模拟执行(实际部署时替换为 ROS 2 action 调用或硬件接口)
result = f"✅ 执行 {skill_name}({json.dumps(params)})"
return result
def execute_plan(plan: List[Dict[str, Any]]) -> None:
"""
按顺序执行技能序列。
"""
print(f"\n{'='*60}")
print(f"开始执行计划,共 {len(plan)} 步")
print(f"{'='*60}\n")
for i, step in enumerate(plan, 1):
skill_name = step["skill"]
params = step.get("params", {})
print(f"[步骤 {i}/{len(plan)}] {skill_name}")
print(f" 参数: {params}")
result = execute_skill(skill_name, params)
print(f" 结果: {result}\n")
print(f"{'='*60}")
print("✅ 任务执行完毕")
print(f"{'='*60}\n")
# ============================================================
# 4. 主流程 —— 端到端演示
# ============================================================
if __name__ == "__main__":
# 用户用自然语言描述任务
task = "去厨房从冰箱里拿一个苹果,放到客厅的桌子上"
print(f"📝 用户任务: {task}\n")
print("🧠 正在调用 GPT-5 进行任务规划...\n")
# 第一步:调用 GPT-5 生成技能序列
plan = plan_with_gpt5(
task_instruction=task,
environment_context="当前机器人位于客厅充电桩附近,厨房和客厅均在可达范围内。"
)
print("📋 规划结果(原始 JSON):")
print(json.dumps(plan, indent=2, ensure_ascii=False))
# 第二步:执行技能序列
execute_plan(plan)
输出示例:
📝 用户任务: 去厨房从冰箱里拿一个苹果,放到客厅的桌子上
🧠 正在调用 GPT-5 进行任务规划...
📋 规划结果(原始 JSON):
[
{
"skill": "move_to",
"params": {"target_location": "kitchen"}
},
{
"skill": "open_door",
"params": {"door_location": "fridge"}
},
{
"skill": "visual_search",
"params": {"object_name": "apple"}
},
{
"skill": "grasp",
"params": {"object_name": "apple", "grasp_type": "power"}
},
{
"skill": "move_to",
"params": {"target_location": "living_room"}
},
{
"skill": "place",
"params": {"target_location": "table"}
}
]
============================================================
开始执行计划,共 6 步
============================================================
[步骤 1/6] move_to
参数: {'target_location': 'kitchen'}
结果: ✅ 执行 move_to({"target_location": "kitchen"})
[步骤 2/6] open_door
参数: {'door_location': 'fridge'}
结果: ✅ 执行 open_door({"door_location": "fridge"})
[步骤 3/6] visual_search
参数: {'object_name': 'apple'}
结果: ✅ 执行 visual_search({"object_name": "apple"})
[步骤 4/6] grasp
参数: {'object_name': 'apple', 'grasp_type': 'power'}
结果: ✅ 执行 grasp({"object_name": "apple", "grasp_type": "power"})
[步骤 5/6] move_to
参数: {'target_location': 'living_room'}
结果: ✅ 执行 move_to({"target_location": "living_room"})
[步骤 6/6] place
参数: {'target_location': 'table'}
结果: ✅ 执行 place({"target_location": "table"})
============================================================
✅ 任务执行完毕
============================================================
上述代码展示了 Code as Policies 的核心思想:LLM 不直接输出低级关节角度,而是输出结构化的技能调用序列,由技能执行器负责落地。实际部署时,execute_skill 会对接 ROS 2 action server 或硬件驱动,而闭环纠错可在执行失败时重新调用 plan_with_gpt5 并传入当前状态作为上下文。
6.2 技能库与任务图
- 技能原语:通过行为树或有限状态机封装,如“抓取”、“放置”、“移动基座”、“开门”等。
- 任务与运动联合规划(TAMP):结合符号规划与运动规划,使用 PDDLStream 或基于 LLM 的 TAMP 框架,处理长序列任务。
7. 运动规划与全身控制
7.1 运动规划
- 基于采样的规划:OMPL 与 MoveIt 3 仍用于臂部运动规划,但增加了与 3DGS 地图的碰撞检测。
- 优化类规划:CHOMP/STOMP 的 GPU 加速版本,处理高维关节空间。
- 学习型规划:扩散策略(Diffusion Policy)与动作分块 Transformer(ACT)直接从视觉生成轨迹,替代传统规划器。
7.2 全身控制(WBC)
- 基于 QP 的控制器:OCS2 和 Crocoddyl 广泛用于人形和四足机器人,处理多任务优先级与接触力约束。
- 强化学习 Sim-to-Real:Isaac Gym + Isaac Sim 训练的运动策略,通过域随机化和 teacher-student 蒸馏直接部署到真实机器人。
- 人形机器人全身控制:2026 年热点,使用 AMP(对抗运动先验)和 human motion retargeting 数据,实现自然行走与上半身操作协同。

8. 仿真与数据闭环
仿真不再只是测试工具,而是数据生产和模型训练的核心。
- 仿真平台:
- NVIDIA Isaac Sim 2026.1:高保真渲染,支持 3DGS 资产导入,内置域随机化。
- SAPIEN 2.0:开源,侧重物理交互,支持可变形物体和流体。
- Genesis:2026 年新秀,高速 GPU 并行仿真,一天可生成数十亿帧交互数据。
- 数据生成流水线:
- 合成数据:通过仿真生成带标签的 RGB-D、分割、6D 位姿、交互序列。
- 真实数据增强:使用 NeRF 风格技术将少量真实数据外推为多样视角。
- 强化学习训练框架:
- Isaac Lab:基于 Isaac Sim 的轻量级 RL 库,支持多 GPU 并行训练。
- RLgames:结合 GPU 仿真与游戏引擎,训练通用操作策略。
9. 典型开源技术栈组合
2026 年 8 月推荐的端到端开源方案:
| 层 | 组件 | 说明 |
|---|---|---|
| 感知 | DINOv3 + SAM 3 + FoundationPose 2.0 | 开放词汇检测、分割、位姿估计 |
| 建图 | 3DGS-SLAM + 语义高斯 | 实时高保真语义地图 |
| 规划 | GPT-5 API + Code as Policies 2.0 | 任务分解与代码生成 |
| 策略 | Octo 2.0(扩散策略微调) | 通用操作策略 |
| 控制 | OCS2 + 强化学习 checkpoint | 全身运动控制 |
| 仿真 | Isaac Sim + Isaac Lab | 训练与数据生成 |
| 中间件 | ROS 2 Humble + Zenoh | 通信与节点管理 |
10. 总结与趋势
2026 年 8 月的具身智能技术栈呈现出几个明显趋势:
- 从模块化到端到端:VLA 模型正逐步取代传统管道,但模块化方案在可解释性和可靠性上仍有优势。
- 世界模型成为标配:3DGS 和神经世界模型让机器人有了“想象力”,可以在脑中预演。
- 仿真即数据引擎:大规模并行仿真降低了对昂贵真实数据的依赖,Sim-to-Real 差距正在快速缩小。
- 人形机器人驱动全身控制:人形机器人对协调操作和移动的要求,推动了 WBC 和 RL 的融合。
- 开源生态繁荣:从感知到控制,几乎每一层都有高质量开源项目,降低了创业门槛。
最后在唠叨一句:
我是小鱼:
- CSDN 博客专家;
- AIGC 技术MVP专家;
- 阿里云 专家博主;
- 51CTO博客专家;
- 企业认证金牌面试官;
- 多个名企认证&特邀讲师等;
- 名企签约职场面试培训、职场规划师;
- 多个国内主流技术社区的认证专家博主;
- 多款主流产品(阿里云等)评测一等奖获得者;
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)