0. 引言

小屌丝:鱼哥,快一个月没更新博客,你这是闭关进修去了?
小鱼:哈哈,算是闭关进修,泡在一堆具身智能最新论文和开源项目里啃资料。
小屌丝:进修也不提前打声招呼,大伙都以为你断更跑路了。
小鱼:门口虚拟 “护法” 都安排上了,沉浸式闭关,谢绝打扰。
小屌丝:…… 你是真能扯,那都是幻觉!咱唠点正经嗑。消失一个月,手是不是都生了?
小鱼:不打紧不打紧,最近行业变化太快,多沉淀一段时间才有干货可以输出。
小屌丝:正好!那咱今天就聊聊当下最火的方向 ——2026 年 8 月最新的具身智能技术栈,这块最近更新迭代简直太快了。
小鱼:说到这个我可来精神了,最近世界模型、VLA、WAM、分层控制路线吵得热火朝天,技术路线都开始内卷了。
小屌丝:对啊,现在早就不是去年简单的 VLM + 动作头那一套了,很多人都说纯 VLA 路线已经摸到天花板。
小鱼:没错,我先梳理下现在主流三条技术路线:第一条传统 VLA(视觉‑语言‑动作);第二条世界模型 World Model;第三条新星 WAM 世界动作模型,三条路线并行赛跑。
小屌丝:那现在主流落地完整技术栈都包含哪些组件?开源这块最近有没有新东西?仿真迁移 Sim‑to‑Real 还是绕不开的痛点吧?
小鱼:你这是面我呢?
小屌丝:嘿嘿,也没有,就是看看你最近的知识储备咋样
小鱼:呦呵?那我们边吃边聊?
小屌丝:非常可以~~

在这里插入图片描述

1. 为什么现在谈具身智能技术栈

2026 年,具身智能(Embodied AI)已经从实验室 demo 走向量产前夜。人形机器人、移动操作臂、四足与轮式平台纷纷进入工厂、物流和家庭场景。但“身体”只是载体,真正让机器人在物理世界中自主完成任务的是背后的技术栈。

本文基于 2026 年 8 月最新的开源框架、商业中间件和学术界共识,梳理一套可落地的具身智能技术栈,覆盖感知、建图、规划、控制、仿真与数据闭环。

2. 总体架构

传感器 / 本体

感知层

世界模型与语义地图

任务规划与决策

运动规划与全身控制

底层执行器

仿真与数据引擎

模型训练与微调

3. 传感器与计算平台

2026 年主流硬件配置:

  • RGB-D 相机:Intel RealSense D457 / 奥比中光 Gemini 2XL,提供 720p 深度+RGB 流,全局快门更适合快速运动。
  • 激光雷达:Livox Mid-360 / 速腾聚创 Helios 系列,用于大范围 SLAM 和避障。
  • 触觉传感器:GelSight Mini / 帕西尼感知 6 维指尖触觉,用于精细操作反馈。
  • IMU & 关节编码器:本体标配,提供本体感知。
  • 算力平台
    • 端侧:NVIDIA Jetson AGX Orin 64GB(主流),少量使用高通 RB6 或华为昇腾 Atlas 200。
    • 云端训练:NVIDIA H100/B200 集群,配合 Lambda Labs 或自建 GPU 云。
      在这里插入图片描述

4. 感知层

4.1 通用视觉基础模型

  • DINOv3:2026 年 Meta 发布的视觉 Transformer,无监督预训练,显著提升开放词汇检测和分割能力。
  • SAM 3:Segment Anything Model 第三代,支持视频帧间一致分割,零样本迁移到机器人视角。
  • CLIP 变体:OpenCLIP 与 SigLIP 仍广泛用于视觉-语言对齐,但正被更轻量、多模态的模型取代。

4.2 具身专用感知

  • 6D 位姿估计:FoundationPose 2.0,支持未见过的物体实时跟踪,结合 NeRF 隐式表示。
  • 手部-物体交互理解:DexYCB 2.0 数据集 + HaMeR(Hand Mesh Recovery)模型,实时重建手部姿态与物体相对位姿。
  • 多模态融合:基于 Transformer 的早期融合策略,将 RGB、深度、触觉、声音、语言指令统一编码为联合嵌入。

5. 世界模型与语义地图

不再满足于几何地图,世界模型成为具身智能的核心。

  • 3D 高斯泼溅(3DGS):2026 年实时 SLAM 标配,以 3D Gaussian Splatting 替代传统点云/网格,实现高保真、可微分的场景重建。
  • 语义高斯:每个 3D 高斯球附带语义特征,使用 CLIP/DINO 特征蒸馏,构建可查询的语义地图。
  • 神经世界模型
    • UniSim 2.0:Google DeepMind 推出的通用世界模型,可基于视觉输入预测未来状态,用于规划评估。
    • 开源方案:IRIS 与 DreamerV4,结合 action-conditioned video prediction 进行内部推演。
      在这里插入图片描述

6. 任务规划与决策

6.1 大语言模型驱动规划

  • LLM-based Planner:以 GPT-5、Gemini 2.5 或开源 Llama 4 为推理核心,将自然语言任务分解为原子技能序列。
  • 代码即策略:利用 LLM 生成 Python 代码调用技能库,如 Google 的 Code as Policies 2.0,支持闭环纠错。
  • 具身 VLA 模型
    • RT-3:Google 的 Robotics Transformer 第三代,直接输出动作 token,支持多模态指令。
    • Octo 2.0:开源通用机器人策略模型,基于扩散策略,可微调适配多种本体。

下面是一个基于 GPT-5 API 的代码即策略实战示例,将自然语言任务分解为可执行的技能序列:

import openai
import json
from typing import List, Dict, Any

# ============================================================
# 1. 技能库定义 —— 机器人可调用的原子技能原语
# ============================================================
SKILL_LIBRARY = {
    "move_to": {
        "description": "移动基座到指定位置",
        "params": ["target_location"],
        "example": 'move_to(target_location="kitchen")',
    },
    "grasp": {
        "description": "抓取指定物体",
        "params": ["object_name", "grasp_type"],
        "example": 'grasp(object_name="apple", grasp_type="power")',
    },
    "place": {
        "description": "将手中物体放置到指定位置",
        "params": ["target_location"],
        "example": 'place(target_location="table")',
    },
    "open_door": {
        "description": "打开门",
        "params": ["door_location"],
        "example": 'open_door(door_location="fridge")',
    },
    "visual_search": {
        "description": "通过视觉搜索并定位物体,返回其坐标",
        "params": ["object_name"],
        "example": 'visual_search(object_name="apple")',
    },
    "wait": {
        "description": "等待指定秒数",
        "params": ["seconds"],
        "example": "wait(seconds=2)",
    },
}

# ============================================================
# 2. GPT-5 API 调用 —— 将自然语言任务分解为技能序列
# ============================================================
def plan_with_gpt5(task_instruction: str, environment_context: str = "") -> List[Dict[str, Any]]:
    """
    调用 GPT-5 API,将自然语言指令分解为技能序列。
    
    参数:
        task_instruction: 自然语言任务描述
        environment_context: 环境上下文(可选),描述当前场景
    
    返回:
        技能序列列表,每个元素为 {"skill": 技能名, "params": {...}}
    """
    client = openai.OpenAI(api_key="your-api-key")  # 实际使用时替换为真实 key
    
    skill_descriptions = "\n".join([
        f"- {name}: {info['description']},参数: {info['params']}"
        for name, info in SKILL_LIBRARY.items()
    ])
    
    system_prompt = f"""你是一个机器人任务规划器。你拥有以下技能库:

{skill_descriptions}

请将用户的任务分解为合理的技能调用序列。输出格式必须为严格的 JSON 数组,每个元素包含 "skill" 和 "params" 两个字段。
注意:
- 技能序列必须按执行顺序排列
- 参数必须来自技能库定义的参数名
- 仅使用技能库中存在的技能
- 如果物体的位置未知,应先调用 visual_search 定位"""
    
    response = client.chat.completions.create(
        model="gpt-5",  # 2026 年 8 月可用模型
        messages=[
            {"role": "system", "content": system_prompt},
            {"role": "user", "content": f"环境上下文:{environment_context}\n\n任务:{task_instruction}"}
        ],
        response_format={"type": "json_object"},  # 强制 JSON 输出
        temperature=0.1,  # 低温度保证稳定输出
    )
    
    plan = json.loads(response.choices[0].message.content)
    # 兼容 GPT-5 可能的外层包装
    if isinstance(plan, dict) and "plan" in plan:
        plan = plan["plan"]
    return plan

# ============================================================
# 3. 技能执行器 —— 模拟执行技能序列(实际部署时替换为真实机器人控制)
# ============================================================
def execute_skill(skill_name: str, params: Dict[str, Any]) -> str:
    """
    执行单个技能,返回执行结果。
    实际部署时,这里会调用机器人底层控制接口。
    """
    if skill_name not in SKILL_LIBRARY:
        return f"❌ 未知技能: {skill_name}"
    
    # 模拟执行(实际部署时替换为 ROS 2 action 调用或硬件接口)
    result = f"✅ 执行 {skill_name}({json.dumps(params)})"
    return result

def execute_plan(plan: List[Dict[str, Any]]) -> None:
    """
    按顺序执行技能序列。
    """
    print(f"\n{'='*60}")
    print(f"开始执行计划,共 {len(plan)} 步")
    print(f"{'='*60}\n")
    
    for i, step in enumerate(plan, 1):
        skill_name = step["skill"]
        params = step.get("params", {})
        
        print(f"[步骤 {i}/{len(plan)}] {skill_name}")
        print(f"  参数: {params}")
        result = execute_skill(skill_name, params)
        print(f"  结果: {result}\n")
    
    print(f"{'='*60}")
    print("✅ 任务执行完毕")
    print(f"{'='*60}\n")

# ============================================================
# 4. 主流程 —— 端到端演示
# ============================================================
if __name__ == "__main__":
    # 用户用自然语言描述任务
    task = "去厨房从冰箱里拿一个苹果,放到客厅的桌子上"
    
    print(f"📝 用户任务: {task}\n")
    print("🧠 正在调用 GPT-5 进行任务规划...\n")
    
    # 第一步:调用 GPT-5 生成技能序列
    plan = plan_with_gpt5(
        task_instruction=task,
        environment_context="当前机器人位于客厅充电桩附近,厨房和客厅均在可达范围内。"
    )
    
    print("📋 规划结果(原始 JSON):")
    print(json.dumps(plan, indent=2, ensure_ascii=False))
    
    # 第二步:执行技能序列
    execute_plan(plan)

输出示例:

📝 用户任务: 去厨房从冰箱里拿一个苹果,放到客厅的桌子上

🧠 正在调用 GPT-5 进行任务规划...

📋 规划结果(原始 JSON):
[
  {
    "skill": "move_to",
    "params": {"target_location": "kitchen"}
  },
  {
    "skill": "open_door",
    "params": {"door_location": "fridge"}
  },
  {
    "skill": "visual_search",
    "params": {"object_name": "apple"}
  },
  {
    "skill": "grasp",
    "params": {"object_name": "apple", "grasp_type": "power"}
  },
  {
    "skill": "move_to",
    "params": {"target_location": "living_room"}
  },
  {
    "skill": "place",
    "params": {"target_location": "table"}
  }
]

============================================================
开始执行计划,共 6 步
============================================================

[步骤 1/6] move_to
  参数: {'target_location': 'kitchen'}
  结果: ✅ 执行 move_to({"target_location": "kitchen"})

[步骤 2/6] open_door
  参数: {'door_location': 'fridge'}
  结果: ✅ 执行 open_door({"door_location": "fridge"})

[步骤 3/6] visual_search
  参数: {'object_name': 'apple'}
  结果: ✅ 执行 visual_search({"object_name": "apple"})

[步骤 4/6] grasp
  参数: {'object_name': 'apple', 'grasp_type': 'power'}
  结果: ✅ 执行 grasp({"object_name": "apple", "grasp_type": "power"})

[步骤 5/6] move_to
  参数: {'target_location': 'living_room'}
  结果: ✅ 执行 move_to({"target_location": "living_room"})

[步骤 6/6] place
  参数: {'target_location': 'table'}
  结果: ✅ 执行 place({"target_location": "table"})

============================================================
✅ 任务执行完毕
============================================================

上述代码展示了 Code as Policies 的核心思想:LLM 不直接输出低级关节角度,而是输出结构化的技能调用序列,由技能执行器负责落地。实际部署时,execute_skill 会对接 ROS 2 action server 或硬件驱动,而闭环纠错可在执行失败时重新调用 plan_with_gpt5 并传入当前状态作为上下文。

6.2 技能库与任务图

  • 技能原语:通过行为树或有限状态机封装,如“抓取”、“放置”、“移动基座”、“开门”等。
  • 任务与运动联合规划(TAMP):结合符号规划与运动规划,使用 PDDLStream 或基于 LLM 的 TAMP 框架,处理长序列任务。

7. 运动规划与全身控制

7.1 运动规划

  • 基于采样的规划:OMPL 与 MoveIt 3 仍用于臂部运动规划,但增加了与 3DGS 地图的碰撞检测。
  • 优化类规划:CHOMP/STOMP 的 GPU 加速版本,处理高维关节空间。
  • 学习型规划:扩散策略(Diffusion Policy)与动作分块 Transformer(ACT)直接从视觉生成轨迹,替代传统规划器。

7.2 全身控制(WBC)

  • 基于 QP 的控制器:OCS2 和 Crocoddyl 广泛用于人形和四足机器人,处理多任务优先级与接触力约束。
  • 强化学习 Sim-to-Real:Isaac Gym + Isaac Sim 训练的运动策略,通过域随机化和 teacher-student 蒸馏直接部署到真实机器人。
  • 人形机器人全身控制:2026 年热点,使用 AMP(对抗运动先验)和 human motion retargeting 数据,实现自然行走与上半身操作协同。

在这里插入图片描述

8. 仿真与数据闭环

仿真不再只是测试工具,而是数据生产和模型训练的核心。

  • 仿真平台
    • NVIDIA Isaac Sim 2026.1:高保真渲染,支持 3DGS 资产导入,内置域随机化。
    • SAPIEN 2.0:开源,侧重物理交互,支持可变形物体和流体。
    • Genesis:2026 年新秀,高速 GPU 并行仿真,一天可生成数十亿帧交互数据。
  • 数据生成流水线
    • 合成数据:通过仿真生成带标签的 RGB-D、分割、6D 位姿、交互序列。
    • 真实数据增强:使用 NeRF 风格技术将少量真实数据外推为多样视角。
  • 强化学习训练框架
    • Isaac Lab:基于 Isaac Sim 的轻量级 RL 库,支持多 GPU 并行训练。
    • RLgames:结合 GPU 仿真与游戏引擎,训练通用操作策略。

9. 典型开源技术栈组合

2026 年 8 月推荐的端到端开源方案:

组件说明
感知DINOv3 + SAM 3 + FoundationPose 2.0开放词汇检测、分割、位姿估计
建图3DGS-SLAM + 语义高斯实时高保真语义地图
规划GPT-5 API + Code as Policies 2.0任务分解与代码生成
策略Octo 2.0(扩散策略微调)通用操作策略
控制OCS2 + 强化学习 checkpoint全身运动控制
仿真Isaac Sim + Isaac Lab训练与数据生成
中间件ROS 2 Humble + Zenoh通信与节点管理

10. 总结与趋势

2026 年 8 月的具身智能技术栈呈现出几个明显趋势:

  1. 从模块化到端到端:VLA 模型正逐步取代传统管道,但模块化方案在可解释性和可靠性上仍有优势。
  2. 世界模型成为标配:3DGS 和神经世界模型让机器人有了“想象力”,可以在脑中预演。
  3. 仿真即数据引擎:大规模并行仿真降低了对昂贵真实数据的依赖,Sim-to-Real 差距正在快速缩小。
  4. 人形机器人驱动全身控制:人形机器人对协调操作和移动的要求,推动了 WBC 和 RL 的融合。
  5. 开源生态繁荣:从感知到控制,几乎每一层都有高质量开源项目,降低了创业门槛。

最后在唠叨一句:
我是小鱼

  • CSDN 博客专家
  • AIGC 技术MVP专家
  • 阿里云 专家博主
  • 51CTO博客专家
  • 企业认证金牌面试官
  • 多个名企认证&特邀讲师等
  • 名企签约职场面试培训、职场规划师
  • 多个国内主流技术社区的认证专家博主
  • 多款主流产品(阿里云等)评测一等奖获得者

关注小鱼,学习【人工智能与具身智能】最新最全的领域知识。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐