一、核心思想

AI Agent 是一个能感知环境、做决策、执行动作的软件系统,核心公式为:

Agent = LLM + Planning(规划) + Memory(记忆) + Tools(工具)

它与普通聊天机器人的本质区别是:Agent 不只是“说”,而是在动态环境中持续观察、判断、执行,直到任务完成。


二、AI Agent 的演进阶段

阶段 特点 关键发展
2022年:对话时代 模型只能基于已有知识回答 Prompt Engineering 为主,只能“说”不能“做”
2023年中:工具时代 模型可调用外部API Function Calling、RAG 出现,AutoGPT 等早期探索
2023年底:编排时代 重视推理框架和多Agent协作 ReAct 范式普及,Coze/Dify 等平台用 DAG 约束流程
2024年底:标准化时代 协议和多模态变重要 MCP 协议、Computer Use、AI编程工具快速发展
2025年:长任务时代 Agent 成为可执行长流程的工作单元 Agent Skills 机制出现,封装固定流程和校验规则
2026年:常驻时代 更接近长期在线的数字工作单元 Skills + Heartbeat(定时唤醒),Harness Engineering 受重视

分水岭:2023年中之前,AI基本只能“说”;之后开始逐渐能“做”。


三、Agent、传统编程、Workflow 的区别

类型 控制方式 适用场景
传统编程 程序员写代码 → 执行结果 逻辑固定、高频执行、高性能要求(如订单扣库存)
Workflow 产品画流程图 → 执行结果 流程清晰、步骤有限、需可视化管理(如审批流)
Agent 用户说意图 → AI决策 → 动态执行 步骤不确定、需理解意图、动态判断(如排查故障)

关键判断:执行路径能提前确定就用 Workflow,不能确定再用 Agent。


四、Agent 核心组件详解

1. Planning(推理与规划)

  • 用 LLM 分析任务状态、拆解目标、决定下一步。
  • 常用技术:Chain-of-Thought (CoT),让模型逐步推理。

2. Memory(记忆)

类型 作用 实现方式
短期记忆 保持对话连续性 上下文历史
长期记忆 积累过去经验 外部知识库(向量数据库、知识图谱)

3. Tools(工具)

  • 让 LLM 能操作外部世界(查数据、调API、读文件、执行代码)。
  • 关键闭环:工具执行后返回结果 → Agent 放入上下文 → 进入下一轮推理(Observation)。

4. Agent Loop(核心运行机制)

每一轮循环做三件事:

  1. LLM 推理:决定下一步(调用工具还是直接回复)。
  2. 执行工具:调用并捕获返回结果。
  3. 写回上下文:将观察结果追加到上下文,继续下一轮。
  • 安全兜底:设置最大迭代轮次(一般10-20轮)或 Token 阈值,防止死循环。

五、Tools 注册与调用标准

1. 数据格式:Function Calling Schema(OpenAI Schema)

  • JSON Schema 描述工具的名称、用途、参数类型和必填字段。
  • 关键在 description:要把使用场景和禁用场景讲清楚,直接影响模型是否调用及参数填充。
  • 示例(慢SQL查询工具):
{
  "type": "function",
  "function": {
    "name": "query_slow_sql",
    "description": "查指定微服务的慢SQL。服务响应慢时用。如果是网络问题,别调这个。",
    "parameters": {
      "type": "object",
      "properties": {
        "service_name": {"type": "string", "description": "服务名"},
        "time_range": {"type": "string", "description": "时间范围 HH:MM-HH:MM"}
      },
      "required": ["service_name", "time_range"]
    }
  }
}
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐