看懂AI Agent的6个术语:从‘聊天机器人‘到‘能干活的助手
看懂 AI Agent 的 6 个术语:从"聊天机器人"到"能干活的助手"
AI工具人 PM 的认知笔记:天天说"AI Agent",但你知道它和 ChatGPT、自动化脚本、传统聊天机器人到底有什么区别吗?这篇文章从进化线切入,拆解一个能干活的 Agent 系统由哪 6 大模块组成。零基础友好,适合产品经理和技术同学一起读。
引子:ChatGPT 和 Agent,不是一回事
你可能每天都在用聊天机器人——ChatGPT、文心一言、Kimi……但最近"Agent"这个词冒出来的频率越来越高。很多人觉得:"这不就是更聪明的聊天机器人吗?"
不是。
它们之间有一个本质的差距——就像"计算器"和"计算器+计算器+算盘+算盘+Excel"的区别。
下面我们从进化史的角度,一步步看过来。看完你会明白:为什么 Agent 不是一个新模型,而是一个系统。
一、AI 助手进化四代:从"死板执行"到"自主干活"
第一代:自动化脚本 —— 精确但死板
"我说东,它就往东;我说西,它就往西。"
自动化脚本(比如 Python 定时删文件、Excel VBA 批量处理)是最早的"智能"形式。
- 优点: 执行准确、不会跑偏
- 缺点: 你得多描述每一步——它听不懂"帮我整理一下"这种模糊指令,你得写清楚"打开 A.xlsx,把第一列转成日期格式,跳过空行,保存为 B.xlsx"
类比: 像一个只会照指令做事的人。你给步骤,他干活。但只要你没说清,他就卡住了。
第二代:传统 Chatbot —— 能听懂,但干不了活
"对话很流畅,一问一答很开心,但说完就没了。"
早期的 Chatbot(比如客服机器人的固定菜单)只能从预设选项里选回答,或者走固定的流程树。
- 优点: 交互方式友好
- 缺点: 范围有限——超出预设流程的事,它什么都做不了
类比: 像一个会接待的客服前台。你能问的问题都在它的知识库里,超范围的它只会说"这个我不太了解"。
第三代:大语言模型(LLM) —— 能聊能说,但永远在等你下一步指令
"啥都能聊,但你是它的主管,它永远在等你下一步。"
ChatGPT 的出现是一个巨大飞跃。它能理解自然语言、写代码、翻译、分析数据。但它本质上是"被动等待指令"。
你问:"帮我查一下最近有哪些好的开源项目"——它会给你一份列表。
但你不能说:"你去搜一下、筛选一下、整理成文档发给我,然后明天记得提醒我看。"——它做不到,因为你给了它一个多步骤任务链,而它每次只响应一次。
关键局限: 单次响应。你让它做一件事,它做完就停了。不会自己决定下一步该做什么。
第四代:AI Agent —— 给它目标,它能自己走流程
"你说目标,剩下的你自己搞定。"
这就是 Agent 和以上所有的本质区别。
Agent = 大语言模型的「大脑」+ AGENTS.md 的「规矩」+ Skills 的「手艺」+ Memory 的「记忆」+ MCP 的「工具箱」+ Subagents 的「分身能力」。
一句话概括:
LLM 是"你说什么我就做什么";Agent 是"你给我目标,我自己想办法完成"。
举几个具体对比:
| 场景 | ChatGPT(LLM) | AI Agent |
|---|---|---|
| "帮我写一篇关于 AI 发展趋势的文章" | 写完就停了 | 先去搜索最新报告 → 整理观点 → 写好初稿 → 检查格式 → 自动发布 |
| "帮我审查这个项目里的代码命名规范" | 给你一段通用建议 | 打开项目文件夹 → 逐文件检查 → 把违规的列成表 → 告诉你改了哪些 |
| "上周那个项目进度到哪了" | 不知道你在说什么 | 翻之前的笔记/记录,给你答案 |
Agent 不是一个新模型,而是一种使用方式——把大模型放进一个有规则、有记忆、有工具、能协作的系统里。
二、一张图看懂进化关系
自动化脚本 -> 精确但死板,全靠人写步骤
↓
传统 Chatbot -> 能对话但范围窄,预定义路径
↓
大语言模型(LLM) -> 能聊能说,但只能被动回应
↓
AI Agent -> 有目标就能自己拆解任务、调工具、记上下文、找人协作
三、六大模块:一个 Agent 是怎么"站起来"干活的
最近看到一张图(清华姜学长「深入浅出剖析 AI」系列第 57 集),把 Agent 系统拆成了 6 个模块。每个模块解决的是一个 LLM 本身不具备的能力。
我们一个一个看。
① AGENTS.md —— 规矩
"这个项目里,你怎么干,别人(和 AI)也要这么干。"
AGENTS.md 是一个项目的行为准则文件。它规定了三件事:
- 项目怎么运行——代码改了谁来审核?测试跑不跑?提交信息格式是什么?
- 哪些能改、哪些不能改——比如数据库结构不能直接改,必须走迁移脚本。
- 提交信息格式——commit message 怎么写,PR 模板是什么。
通俗理解: 一个新入职的员工收到一本《员工手册》。AGENTS.md 就是那本手册——告诉 AI:"在这个项目里,规则是这样的。"
没有它,AI 就像一个有本事但没有纪律的人——能干很多事,但每次做事方式不一样,最后项目乱掉。
LLM 为什么不需要这个? 因为 LLM 是被动的,每次对话都是独立的。但当你让它长期参与一个项目时,就需要这份"规矩"来约束它。
② Skill —— 手艺
"按需调用,不占脑子;是工具墙,不是杂物堆。"
Skill 是 AI 掌握的专项能力。不是"什么都会一点"的万能助手,而是:
- 知道什么时候该用什么技能
- 用完就放下,不留印象污染上下文
- 同类技能归类整齐(设计类放一起、开发类放一起)
通俗理解: 像一个装修师傅的工具箱。需要锤子的时候找锤子,需要电钻的时候找电钻。
关键区别:技能是要选的(按场景触发),不是什么都往上堆(全加载到上下文里吃 token)。
③ Memory —— 记忆
"记得准、连得上项目背景;规则经验,该忘就忘。"
Memory 解决的是"上一轮说过啥"的问题。一个 Agent 如果只有当下对话的上下文,它就不记得你三天前跟它说过什么、上次做到哪一步了。
好的记忆系统有两个原则:
- 记得准——只存重要的、不会过期的东西(项目结构、用户偏好、决策结论)
- 该忘就忘——临时调试的细节、一次性的中间步骤,说完就丢
通俗理解: 人的大脑就是这样——记得住密码和经验,但不记得昨天中午吃了啥。AI 的记忆也应该是这个逻辑。
和 LLM 的区别: ChatGPT 也能"记住"当前对话里的内容,但一旦刷新页面、开新对话就全忘了。Agent 的记忆可以跨会话保留——周一说的需求,周三继续用时它还��得。
④ MCP —— 工具连接
"统一插座,让 Agent 真正动手。"
MCP(Model Context Protocol)是 Anthropic 推出的工具连接协议。它定义了:
- AI 怎么调用外部工具(搜索、浏览器、API、数据库……)
- 它是一个标准接口——不管什么工具,都通过同一个"插座"插进来
- 有了它,AI 不再只是"嘴上说说",可以真正执行操作
通俗理解: 就像 USB 接口——以前不同设备要不同的线,现在一根线都能插。MCP 让 AI 调各种工具时有一个统一的方式。
这是 LLM 和 Agent 最本质的区别之一:大语言模型本身只会输出文字;只有通过 MCP 接入工具后,它才能打开浏览器、调用 API、操作文件——从"说"变成"做"。
⑤ A2A —— Agent 协作(Agent-to-Agent)
"Agent 互相递名片,然后交接任务。"
A2A 描述的是多个 Agent 之间怎么合作:
- Agent A 发现自己搞不定,找到擅长这件事的 Agent B
- 双方交换基本信息(名片),确认能力和任务边界
- Agent A 把手头的工作交给 Agent B 继续做,做完再传回来
通俗理解: 像公司里的跨部门协作。产品经理不懂技术细节,就把需求交给技术团队;技术团队搞完了再把成果交回给产品经理审核。
这不是"一个人做所有事",而是"一群专家接力完成一件事"。
LLM 做不到的: 两个 ChatGPT 对话窗口不会互相知道对方在干什么。Agent 系统中不同 Agent 可以协作、交接。
⑥ Subagents —— 分身
"任务太大做不完?拆出去并行处理。"
Subagent 是把一个大任务拆开并行执行的子代理。比如:
- 主 Agent 接到"帮我审查这个项目的 50 个文件"
- 派出 3 个子 Agent,分别查文档规范、检查注释、核对命名
- 各自完成后汇总结果
通俗理解: 领导接了一个大项目,分成 3 个小组同时推进,最后各自交报告。
注意:Subagent 和 A2A 的区别——A2A 更像两个独立团队交接,Subagent 更像你同时派了三个分身去干活。
四、六块拼在一起,才是完整的 Agent 系统
只会聊天的不算 Agent。能真正干活的 Agent = 规矩 + 手艺 + 记忆 + 插座 + 协作 + 分身。
| 模块 | 解决的问题 | 类比 | LLM 自带? |
|---|---|---|---|
| AGENTS.md | 怎么干 | 员工手册 | ❌ |
| Skill | 会干什么 | 工具箱 | ❌(但会很多) |
| Memory | 记得什么 | 大脑记忆 | ⚠️(仅限当前对话) |
| MCP | 能调什么工具 | 通用插座 | ❌ |
| A2A | 怎么跟别人合作 | 跨部门协作 | ❌ |
| Subagents | 怎么处理大任务 | 分身并行 | ❌ |
除了 Skill(LLM 本身就有大量知识),其余五项都是 LLM 原生不具备的。它们是"把聊天框变成一个系统"的关键。
五、搭好你的 Agent 前,先问自己:我缺的是哪一块?
- 规矩写清楚了吗? —— AGENTS.md 有没有定义项目约束?
- 技能按需用了吗? —— 是不是所有功能都一股脑塞给 AI?
- 记忆可靠吗? —— 会不会忘了重要上下文,或者记了一堆没用信息?
- 工具接上了吗? —— AI 能操作外部工具吗?还是只能"嘴炮"?
- 流程设计清楚了吗? —— 复杂任务谁先做、谁后做?交接标准是什么?
- 能并行处理吗? —— 能不能拆出子代理加快进度?
一个建议: 如果你刚开始用 AI 做开发、写作、研究类工作,优先搞定前三项——规矩、手艺、记忆。这四步稳了,后面的工具连接和协作自然水到渠成。
写在最后
AI Agent 不是什么神奇的新物种——它是一个被规矩约束、会用手艺、记得住事、能借工具、会找人帮忙、还能分身搞并行的"完整打工人"。
ChatGPT 给了你一副���脑,Agent 给了你一个工位。
看完这张图(6 大模块),再去看任何介绍 Agent 的文章、工具、产品,你至少知道它在说什么了。
参考资源
- 清华姜学长「深入浅出剖析 AI」系列第 57 集:知道这 6 个 AI Agent 术语,看懂任何一个 Agent(抖音)
- Anthropic MCP 官方文档:https://modelcontextprotocol.io/
本文基于公开资料整理,适合对 AI Agent 概念尚不清晰的入门同学阅读。如果你是技术同学,也可以把这篇文章分享给非技术同事——他们迟早会听到 Agent 这个词。
📚 这是「认知科普」系列的第 1 篇
- 下期预告:Agent 实战——用一个具体场景演示 AGENTS.md + Skill + Memory 怎么配合工作
- 相关系列:
- 产品经理用 AI 搭建内容发布实战——从零到全自动
- AI 工具人 PM 的知识系统搭建指南
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)