AI Agent 核心概念
·
一、核心思想
AI Agent 是一个能感知环境、做决策、执行动作的软件系统,核心公式为:
Agent = LLM + Planning(规划) + Memory(记忆) + Tools(工具)
它与普通聊天机器人的本质区别是:Agent 不只是“说”,而是在动态环境中持续观察、判断、执行,直到任务完成。
二、AI Agent 的演进阶段
| 阶段 | 特点 | 关键发展 |
|---|---|---|
| 2022年:对话时代 | 模型只能基于已有知识回答 | Prompt Engineering 为主,只能“说”不能“做” |
| 2023年中:工具时代 | 模型可调用外部API | Function Calling、RAG 出现,AutoGPT 等早期探索 |
| 2023年底:编排时代 | 重视推理框架和多Agent协作 | ReAct 范式普及,Coze/Dify 等平台用 DAG 约束流程 |
| 2024年底:标准化时代 | 协议和多模态变重要 | MCP 协议、Computer Use、AI编程工具快速发展 |
| 2025年:长任务时代 | Agent 成为可执行长流程的工作单元 | Agent Skills 机制出现,封装固定流程和校验规则 |
| 2026年:常驻时代 | 更接近长期在线的数字工作单元 | Skills + Heartbeat(定时唤醒),Harness Engineering 受重视 |
分水岭:2023年中之前,AI基本只能“说”;之后开始逐渐能“做”。
三、Agent、传统编程、Workflow 的区别
| 类型 | 控制方式 | 适用场景 |
|---|---|---|
| 传统编程 | 程序员写代码 → 执行结果 | 逻辑固定、高频执行、高性能要求(如订单扣库存) |
| Workflow | 产品画流程图 → 执行结果 | 流程清晰、步骤有限、需可视化管理(如审批流) |
| Agent | 用户说意图 → AI决策 → 动态执行 | 步骤不确定、需理解意图、动态判断(如排查故障) |
关键判断:执行路径能提前确定就用 Workflow,不能确定再用 Agent。
四、Agent 核心组件详解
1. Planning(推理与规划)
- 用 LLM 分析任务状态、拆解目标、决定下一步。
- 常用技术:Chain-of-Thought (CoT),让模型逐步推理。
2. Memory(记忆)
| 类型 | 作用 | 实现方式 |
|---|---|---|
| 短期记忆 | 保持对话连续性 | 上下文历史 |
| 长期记忆 | 积累过去经验 | 外部知识库(向量数据库、知识图谱) |
3. Tools(工具)
- 让 LLM 能操作外部世界(查数据、调API、读文件、执行代码)。
- 关键闭环:工具执行后返回结果 → Agent 放入上下文 → 进入下一轮推理(Observation)。
4. Agent Loop(核心运行机制)
每一轮循环做三件事:
- LLM 推理:决定下一步(调用工具还是直接回复)。
- 执行工具:调用并捕获返回结果。
- 写回上下文:将观察结果追加到上下文,继续下一轮。
- 安全兜底:设置最大迭代轮次(一般10-20轮)或 Token 阈值,防止死循环。
五、Tools 注册与调用标准
1. 数据格式:Function Calling Schema(OpenAI Schema)
- 用 JSON Schema 描述工具的名称、用途、参数类型和必填字段。
- 关键在
description:要把使用场景和禁用场景讲清楚,直接影响模型是否调用及参数填充。 - 示例(慢SQL查询工具):
{
"type": "function",
"function": {
"name": "query_slow_sql",
"description": "查指定微服务的慢SQL。服务响应慢时用。如果是网络问题,别调这个。",
"parameters": {
"type": "object",
"properties": {
"service_name": {"type": "string", "description": "服务名"},
"time_range": {"type": "string", "description": "时间范围 HH:MM-HH:MM"}
},
"required": ["service_name", "time_range"]
}
}
}
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)