核心基础层:Agent 的三大支柱
这是整个体系的基石,位于图的最上方和中间层。它认为一个合格的 Agent 必须由三个核心部分组成:

上下文 (Context) - 左侧分支
第 2 章:上下文工程
这是关于如何让 AI “听懂”并“记住”当前任务的关键。
关键词解读:
提示工程: 如何写出好的 Prompt。
KV Cache / 压缩: 解决长文本记忆的技术,让模型处理更长的对话而不遗忘。
Skills / 状态栏: 给 AI 设定人设、技能包和当前状态,让它知道自己是谁、在干什么。
第 3 章:用户记忆和知识库
这是关于 AI 的“长期记忆”。
关键词解读:
RAG: 检索增强生成,让 AI 能查阅外部资料回答问题,减少胡说八道。
结构化索引 / Agentic RAG: 更高级的记忆检索方式,让 AI 像人一样有逻辑地查找知识。

工具 (Tools) - 中间分支
这是关于 AI 的“双手”,让它能干活。
第 4 章:工具
MCP: 模型上下文协议,一种标准化的连接 AI 和数据/工具的方式。
工具安全 / 异步事件架构: 保证 AI 调用工具时不闯祸,并且能高效处理多任务。
第 5 章:Coding Agent 与代码生成
这是目前最火的工具能力——写代码。
代码即思考: 通过写代码来解决问题,而不仅仅是生成文本。
Agent 自举: AI 自己写代码来升级自己。

模型 (Model) - 右侧分支
这是关于 AI 的“大脑”,决定智商上限。
第 6 章:评估
怎么知道你的 Agent 聪不聪明?
Benchmark / LLM-as-Judge: 用考试或让更强的 AI 来当考官打分。
第 7 章:模型后训练
如何让通用大模型变成专用 Agent 模型?
SFT / 强化学习 / LoRA: 微调技术,专门训练 AI 的逻辑推理和工具使用能力。

进阶与应用层:未来的方向
图的最下方虚线框部分,代表了在掌握基础后,Agent 技术的高级形态和未来趋势:

第 8 章:Agent 自我进化
概念: 不再需要人类手把手教,AI 自己能从失败中学习(经验学习),甚至自己发现新工具、创造新工具。这是通往 AGI(通用人工智能)的重要一步。
第 9 章:多模态与实时交互
概念: AI 不再只是文字聊天。
语音 / Computer Use / VLA 机器人: 它能听会说,能直接操作电脑屏幕(像人一样点鼠标),甚至控制实体机器人(VLA 是视觉-语言-动作模型)。
第 10 章:多 Agent 协作
概念: 单打独斗不如群策群力。
共享上下文 / 管理者 / 去中心化: 让多个不同专长的 AI(比如一个负责写代码,一个负责测试,一个负责产品)组成一个团队自动完成复杂任务。

总结
这张图其实讲述了一个 AI Agent 的成长故事:
先给它装上好脑子(模型与评估);
再教它说话和记忆(上下文与知识库);
给它配上好用的手(工具与代码能力);
最后让它进化,学会看、听、操作实物,并且能和小伙伴一起工作(自我进化、多模态、多智能体协作)。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐