前言:AI真正的终点,不是回答问题,而是改变现实世界

过去几年:

AI的发展主要发生在数字世界。

例如:

ChatGPT:

负责文字生成。

Copilot:

负责代码辅助。

但是现实世界中的任务:

并不是只有文字。

机器人需要:

看到环境。

理解目标。

规划动作。

执行任务。

例如:

未来家庭机器人:

用户:

帮我整理一下桌面。

机器人需要:



理解指令

↓

观察桌面

↓

识别物体

↓

规划路径

↓

抓取物品

↓

完成整理

这已经不是简单的大模型问题。

而是:

具身智能(Embodied AI)。


一、为什么机器人时代需要Agent?

传统机器人:

执行固定程序。

例如:

工业机械臂:



移动到A点

↓

抓取

↓

移动到B点

↓

放下

问题:

环境变化后:

无法处理。

例如:

桌子上的物体位置变化。

传统机器人:

重新编程。


AI Agent机器人:

目标驱动。

例如:

用户:

把桌面整理干净。

Agent:

自主拆解:



任务:

整理桌面


子任务:

1. 找到垃圾

2. 找到书籍

3. 分类物品

4. 放置到对应位置

核心变化:

从:

程序控制。

变成:

智能决策。


二、机器人Agent完整架构

未来机器人系统:

不是一个模型。

而是多个模块组合。




                 用户指令

                     |

                 LLM Agent

                     |

          ----------------------

          |          |          |

       Memory    Planner     Tool


                     |

                Robot Control


                     |

          ----------------------

          |                    |

       Vision              Action


          |                    |

       Camera              Motor


其中:

LLM Agent

负责:

理解任务。


Vision

负责:

观察世界。


Planner

负责:

任务规划。


Control

负责:

执行动作。


三、机器人为什么需要多模态模型?

文字模型:

只能处理:

语言。

但是机器人面对:

真实世界。

需要:

视觉。

声音。

触觉。


例如:

机器人看到:



图片:

桌子

杯子

书

垃圾

需要理解:

“杯子应该放厨房。”

“垃圾应该丢弃。”

这需要:

视觉语言模型。


四、VLM:让AI拥有视觉理解能力

VLM:

Vision Language Model。

架构:




图片

 |

Vision Encoder

 |

视觉特征

 |

LLM

 |

文字理解


例如:

输入:

图片 + 问题。

用户:

桌子上有什么危险物品?

VLM:

回答:

发现一把剪刀,位于桌面右侧。


代表模型:

  • GPT-4o Vision;
  • Gemini Vision;
  • Qwen-VL。

五、视觉模型和VLM有什么区别?

很多人容易混淆。

YOLO

解决:

检测。

例如:

图片:

找到:



person

chair

cup

输出:

位置。


VLM

解决:

理解。

例如:

图片:

问:

这个人在做什么?

回答:

他正在维修设备。


机器人需要:

二者结合。

架构:



Camera

↓

YOLO

↓

目标检测

↓

VLM

↓

场景理解

↓

Agent

六、机器人Agent如何进行任务规划?

这是核心问题。

用户:

帮我做一杯咖啡。

Agent不能直接执行。

需要规划。


简单规划:



目标:

制作咖啡


步骤:

1. 找杯子

2. 找咖啡粉

3. 加水

4. 启动机器

5. 等待完成

这个过程:

叫:

Task Planning。


七、ReAct:目前Agent常用推理模式

ReAct:

Reason + Act。

即:

思考。

行动。

流程:




Thought:

需要找到咖啡机。


Action:

移动到厨房。


Observation:

发现咖啡机。


Thought:

需要咖啡粉。


Action:

寻找咖啡粉。


机器人Agent大量采用类似思想。


八、机器人如何控制动作?

LLM不能直接控制电机。

需要中间层。

架构:




LLM

 |

任务规划

 |

Motion Planner

 |

Controller

 |

Motor


例如:

LLM:

“拿起杯子”。

转换:

机械控制:



机械臂移动

↓

调整角度

↓

闭合夹爪

↓

提升


常用技术:

  • ROS;
  • MoveIt;
  • 控制算法。

九、ROS:机器人开发的重要基础

ROS:

Robot Operating System。

不是操作系统。

更像:

机器人软件框架。


架构:




Camera Node

      |

Vision Node

      |

Planning Node

      |

Control Node


节点之间:

通过消息通信。


例如:

摄像头节点:

发布:

图片。

视觉节点:

订阅:

图片。


十、Memory:机器人为什么需要长期记忆?

普通机器人:

每次重新开始。

未来机器人:

需要记住主人。

例如:

第一次:

用户:

我喜欢喝黑咖啡。

保存:



{

"preference":

"black coffee"

}

以后:

自动准备。


Memory包括:

短期记忆

当前任务。

例如:

正在做饭。


长期记忆

用户习惯。

例如:

饮食偏好。


世界记忆

环境信息。

例如:

杯子通常放在哪里。


十一、机器人最大的难题:世界模型

目前AI:

会识别。

但是:

不真正理解世界。

例如:

看到杯子。

AI知道:

这是杯子。

但是:

是否知道:

杯子掉下来会碎?


这就是:

World Model。

目标:

让AI学习:

现实世界规律。


世界模型需要理解:



物体

+

空间

+

物理规律

+

因果关系

例如:

机器人预测:

移动这个盒子。

会挡住摄像头。


十二、为什么具身智能现在爆发?

几个因素:


1. 大模型提供“大脑”

LLM:

提供:

推理能力。


2. 视觉模型提供“眼睛”

VLM:

理解环境。


3. 机器人硬件成熟

例如:

机械臂。

人形机器人。


4. 仿真训练发展

机器人训练:

成本很高。

所以大量使用:

模拟环境。

例如:

Isaac Sim。


十三、个人开发者如何进入机器人AI?

不需要直接造机器人。

路线:


阶段1:AI Agent

学习:

  • LLM;
  • RAG;
  • MCP。

阶段2:视觉AI

学习:

  • YOLO;
  • OpenCV;
  • TensorRT。

阶段3:机器人系统

学习:

  • ROS2;
  • MoveIt。

阶段4:具身智能

学习:

  • VLM;
  • 强化学习;
  • 世界模型。

十四、未来机器人技术栈

完整路线:




             AI Agent

                 |

          ----------------

          LLM       Memory


                 |

              VLM视觉


                 |

          ----------------

          ROS2

                 |

          控制系统


                 |

             Robot


十五、未来五年最可能爆发的方向

1. 工业机器人Agent

最快落地。

场景:

  • 质检;
  • 搬运;
  • 维护。

2. AI办公机器人

例如:

自动整理文件。

会议助手。


3. 家庭机器人

长期目标。


4. AI+智能设备

例如:

眼镜。

汽车。

机器人。


总结:AI正在从“数字智能”进入“物理智能”

过去:

AI存在于屏幕里。

未来:

AI进入现实世界。

完整路径:



大语言模型

↓

Agent

↓

多模态模型

↓

机器人控制

↓

具身智能

真正的智能:

不是会回答问题。

而是:

能够理解世界,并采取行动。

未来最大的AI机会:

可能不是再造一个聊天机器人。

而是:

让AI拥有身体,进入现实世界。


下一篇:

AI Agent工程师成长路线:从调用API到构建下一代智能系统

将总结整个专栏:

  • AI工程技能树;
  • 学习路线;
  • 项目实战规划;
  • 就业方向;
  • 未来5年技术机会。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐