对agent概念的初步介绍


写在前面

2026 年的技术圈,如果你还只会说"大模型能聊天",那明显已经不够用了。从 ChatGPT 的自定义 GPT、到 AutoGPT、再到各类 Coding Agent(如 Codex、Claude Code),以及国内百度的千帆、阿里的百炼、字节的扣子(Coze),大家都在聊同一个词——Agent(智能体)。

但 Agent 到底是个啥?它和普通的聊天机器人(Chatbot)有什么区别?为什么一个 LLM 接上"工具"之后,就显得"聪明"了很多?

这篇博客我们就来把 Agent 的基础概念讲透,不堆术语,尽量用大白话 + 示意图 + 代码把事情说明白。


一、什么是 Agent?

简单说,Agent 是一个能够感知环境、自主做决策、并通过调用工具执行动作以完成目标的系统。

如果给一个更工程化的定义:

AI Agent = 大语言模型(大脑) + 规划能力(拆解任务) + 记忆(记住上下文和经验) + 工具(手脚,去真实世界干活)

传统的 Chatbot 是"你问我答":你输入一句话,它生成一句话,一问一答,没有"后续"。

而 Agent 是"你给目标,它自己去办":你说"帮我查一下明天北京飞上海的航班,挑最便宜的订上",它会自己拆步骤、查网站、填表单、确认支付,全程不需要你一步步指挥。

这就是本质区别:Chatbot 是被动响应,Agent 是主动执行。


二、Agent 和 Chatbot、Workflow 的区别

很多人分不清这三者的边界,用一张表说清楚:

维度Chatbot(聊天机器人)Workflow(工作流)Agent(智能体)
决策者人预定义流程LLM 自主决策
灵活性低,一问一答中,按固定步骤走高,可动态调整
是否调用工具通常不硬编码调用自主判断何时调用
错误处理无规则分支自我反思、重试
典型例子客服问答Zapier 自动化AutoGPT、Manus

一句话总结:Workflow 是把"人写的流程"自动化;Agent 是把"人的判断力"自动化。


三、Agent 的核心组成

一个能跑起来的 Agent,通常离不开下面四个模块。这也是目前主流框架(LangChain、LlamaIndex、MetaGPT 等)都在围绕搭建的东西。

1. 规划(Planning)—— 拆解任务的能力

Agent 拿到一个复杂目标,第一步不是蛮干,而是把大目标拆成可执行的子任务。

常见的规划策略:

  • ReAct(Reason + Act):边思考边行动,最主流的范式(后面详解)。

  • Plan-and-Execute:先制定完整计划,再逐步执行,适合长任务。

  • Reflection(反思):执行完一轮后自我评估,不满意就重来。

2. 记忆(Memory)—— 记得住东西

LLM 本身只有"对话窗口"那点记忆,关掉就没了。Agent 需要两类记忆:

  • 短期记忆:当前任务的上下文(对话历史、中间结果),一般就放在上下文窗口里。

  • 长期记忆:跨会话保存的知识、用户偏好、历史经验,通常靠向量数据库(如 Milvus、Chroma、pgvector)来实现"记住并检索"。

工程经验:上下文窗口是有限的、且很贵。所以"上下文工程"(Token 管理、压缩、分层记忆)是 Agent 落地最头疼也最关键的环节之一。

3. 工具(Tools)—— 去真实世界干活的手脚

这是 Agent 从"嘴炮"变"实干"的关键。工具就是给 LLM 调用的函数,比如:

  • 搜索(web_search)

  • 代码执行(run_python)

  • 调用 API(查天气、订机票、发邮件)

  • 操作数据库(sql_query)

  • 读/写文件

LLM 通过 Function Calling(函数调用) 来使用工具:它输出一个结构化的"我要调用哪个函数、参数是什么",由外部程序真正执行,再把结果喂回给模型。

4. 行动(Action)—— 真正落地

行动就是"调用工具后的结果",以及根据结果决定下一步。它和前面三块合在一起,形成了一个可以不断循环的闭环。


四、核心机制:ReAct 循环

理解了组件,我们来看 Agent 真正"动起来"的方式——ReAct 范式(Reasoning + Acting)。

它的核心是一个循环:思考(Thought)→ 行动(Action)→ 观察(Observation),不断重复,直到任务完成。

用 Mermaid 画出来就是:


任务完成

用户给出目标

思考 Thought

决定下一步动作 Action

调用工具 Tool

观察结果 Observation

返回最终结果

举个具体例子,目标是"北京明天会下雨吗?如果会,提醒我带伞":

Thought: 我需要先查北京明天的天气。
Action: web_search("北京 明天 天气 降雨")
Observation: 北京明天小雨,降水概率 70%。
Thought: 明天会下雨,我应该提醒用户带伞。
Action: send_message("明天北京有小雨,记得带伞 ☔")
Observation: 消息已发送。
Thought: 任务完成。

注意这里的关键点:

  • Agent 是自己决定何时调用工具的,不是人告诉它的;

  • 每一步都基于上一步的观察结果做调整;

  • 它有个终止条件(任务完成 / 步数上限 / 预算耗尽),否则会无限循环烧钱。

实践建议:生产环境一定要给 Agent 加"护栏"——最大步数、预算上限、工具白名单,否则一个失控的循环可能几分钟花掉你几十美元。


五、Agent 的常见类型

按复杂度和协作方式,可以大致分为:

  1. 单 Agent(Single Agent):一个模型 + 一套工具,独立完成目标。最简单,适合明确任务。

  2. 多 Agent(Multi-Agent):多个角色分工协作,比如"产品经理 Agent"写需求、"工程师 Agent"写代码、"测试 Agent"找 bug(MetaGPT 就是这种思路)。

  3. 反思式 / 自迭代 Agent:执行后自我评估并改进,把"教训"持久化,下次做得更好。


六、主流框架与产品速览

名称定位特点
LangChain / LangGraph开发框架生态最全,适合自己搭 Agent
AutoGPT自主 Agent早批"出圈"的自主任务执行
MetaGPT多 Agent用软件公司角色协作写项目
Dify低代码平台可视化搭工作流和 Agent
扣子 Coze低代码平台字节出品,上手快,适合轻量场景
Codex / Claude CodeCoding Agent专为写代码、跑命令行而生

新手建议:先用 Dify / Coze 这类低代码平台拖拽体验,再用 LangChain 写代码深入原理。


七、挑战与局限

Agent 很强,但远没到"万能"的程度,落地时要正视这些问题:

  • 幻觉与错误传播:Agent 一旦某步判断错了,错误会沿着循环放大。

  • 成本与延迟:多步循环意味着多次调用 LLM,又慢又贵。

  • 可控性差:自主决策意味着结果不完全可预测,在金融、医疗等场景要格外谨慎。

  • 工具可靠性:工具本身有 bug 或返回异常,Agent 需要有兜底和重试。

  • 安全风险:Agent 能发邮件、能转账,就必须严控权限,防止"跑飞"。


八、总结 & 学习路径

一句话记住 Agent:它是"会自己想办法完成目标的大模型",核心靠规划 + 记忆 + 工具,跑在 ReAct 循环里。

如果你想动手学,推荐这条路线:

  1. 打基础:搞懂 LLM 的 Token、上下文窗口、Function Calling 是什么。

  2. 读原理:理解 ReAct、Plan-and-Execute、Reflection 三种范式。

  3. 抄代码:用 LangChain 写一个简单的"搜索 + 回答" Agent。

  4. 做项目:给它接上数据库 / API,做一个能真正干活的场景(比如"自动整理邮件""自动生成周报")。

  5. 补工程:学上下文压缩、向量检索、护栏与可观测性,把它变成能上线的系统。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐