1.概念:

一个以大型语言模型为核心,具备自主理解、规划、记忆和工具使用能力,能够为了达成特定目标而与环境持续交互的计算实体,通俗一点来说就是“你告诉它做什么,它自己想办法怎么做”。

2.类别:

2.1基于智能与架构分类:

简单反射性、目标导向型、学习型

2.2基于大模型应用分类:

单agent系统、多agent系统

3.原理

AI Agent = LLM大脑 + 记忆 + 任务规划 + 工具

3.1大脑

核心驱动,通常是一个强大的LLM大模型(如GPT-4,千问)

3.2记忆
短期记忆

对话的上下文窗口(Context Window)

长期记忆

为了让agent能记住跨对话的信息,通常使用外部数据库,最常见的是向量数据库,用于存储和检索过去的检验

3.3规划器

负责任务分解、反思和决策。可以是简单的ReAct 模式,也可以是更复杂的如思维树。

3.3.1ReAct模式
1.概念:

ReAct模式(ReAct = Reasoning + Acting,推理 + 行动)

2.核心思想:

LLM 的思考过程(Reasoning)和外部工具行动(Act)写进 Prompt(提示词),交替执行,让大模型一边想、一边调用工具

3.区别:

纯 CoT(思维链) 只在模型内部推理,不与外部进行交互;ReAct 是「思考 → 动手调用工具 → 看结果 → 继续思考」的循环过程

4.核心循环:

Thought(思考) → Action(行动) → Observation(观察)

4.1Thought(思考):LLM 用自然语言输出内心思考

例如:用户问现在最新的天气情况,我知识库里面并没有最新的数据,这个时候需要用到搜索工具查询了

4.2Action:输出结构化工具调用(工具名 + 参数),由程序执行工具

例如:参数,某年某月某月某地点最新时间的天气情况

4.3Observation:拿到工具返回的结果,作为环境反馈,塞回上下文

例:返回网页文本:某年某月某月某地点最新时间的天气是多云

然后回到 Thought,继续判断:

信息足够  → 生成最终答案,终止循环

信息不足  → 继续下一轮 Thought→Action→Observation

拿到错误结果  → 调整思路,换工具 / 换 query 问题重试

*注:思考不能只在脑子里,想到需要外部信息就去调用工具,拿到外部信息再继续推理

5.ReAct Prompt 模板
你是一个天气查询智能体,可以使用工具获取实时天气。
严格遵守输出格式,每一轮必须输出 Thought,Action,Action Input。
当信息足够回答用户问题时,输出 Final Answer,停止调用工具。

可用工具:
WeatherSearch[city]:查询指定城市最新实时天气,参数为城市名,例如 WeatherSearch["合肥"]

输出规则:
1. Thought:思考当前需要做什么,是否需要调用工具
2. Action:工具名称,只能写 WeatherSearch
3. Action Input:工具入参,写城市名称
4. 拿到Observation之后再继续思考,不要编造天气数据!

用户问题:{input}

开始:

交互示例

用户问题:合肥今天天气怎么样?

Thought: 用户想查询合肥今天实时天气,我的知识库没有实时天气,需要调用WeatherSearch工具查询合肥。
Action: WeatherSearch
Action Input: 合肥
Observation: 合肥,2026-09-29,晴,气温20~28℃,微风,空气质量良
Thought: 已经获取合肥今日完整天气信息,不需要再调用工具,可以整理答案。
Final Answer:合肥今日天气:晴,气温20~28℃,微风,空气质量良。
6.优缺点

优点:

1.直观,逻辑贴近人类解决问题的思路

2.推理和工具调用交织,减少幻觉

3.实现简单,是工业 Agent 最基础的底座

4.方便调试:Thought 可以打印出来,看模型到底怎么想的

缺点:

1.长任务容易迷失:多轮循环上下文越来越长,容易忘记最初目标

2.容易陷入死循环:反复调用同一个工具,没有新信息

3.没有顶层全局规划:属于增量式思考,不会先一次性写出完整任务计划(这点和 Plan-and-Solve 最大区别)

4.依赖 LLM 遵守输出格式(有时候模型不按规范写 Action,解析失败)。

对比:

  • ReAct:边走边想,边推理边行动(增量式)
  • Plan-and-Solve:先写完整全局计划,再一步步执行计划
3.4工具箱

Agent与外界交互的桥梁如:搜索引擎api、计算器、代码执行器、数据库查询接口、其他应用API

3.5工作原理

概括:Agent 是能自主感知目标、规划步骤、调用工具、迭代执行、反思纠错,直到完成任务的大模型系统,区别于普通大模型 “一问一答”,Agent 拥有自主循环执行能力。

1.基本组成 (五大核心模块)
  1. 感知模块(Observation) 获取外部信息:用户指令、工具返回结果、环境状态(数据库查询、网页搜索、API 返回、代码执行结果),作为输入。
  2. 大脑:大模型 LLM(推理核心) 负责理解目标、思考、决策、写计划、生成工具调用参数、反思结果。LLM 本身不会直接操作外部世界,只输出思考文本 + 工具调用指令。
  3. 规划模块(Planning) 把复杂大任务拆解成多个子任务。 两种典型思路:
  • 链式思考:一步步串行做(ReAct)
  • 分层规划:先生成整体方案,再逐个执行子任务(Plan-and-Solve)
  1. 工具集(Tools / Actions) Agent 能调用的外部能力,用来弥补大模型短板(实时信息、计算、读写文件、API、数据库、代码解释器)。 例如:搜索、计算器、OCR、向量库、爬虫、接口调用。
  2. 记忆模块(Memory) 保存历史信息,是 Agent 持续工作的关键,分三类:
  • 短时记忆:本轮对话 / 任务上下文(Prompt 窗口内),保存本次思考、工具返回、中间结果
  • 长时记忆:向量数据库存储,跨任务持久记忆(过往经验、知识库)
  • 反思记忆:记录失败案例,用来后续优化决策
2.执行循环:

1.ReAct 范式 

思考 (Thought) → 行动 (Action) → 观察 (Observation),循环往复

Plan-and-Resolve(规划优先,适合复杂长任务) 

  1. LLM 先一次性生成完整任务清单(整体规划)
  2. 按顺序逐个执行子任务,每个子任务内部再走 ReAct 循环
  3. 遇到失败可以动态修改计划

适合:写调研报告、数据分析、项目拆解;缺点:一开始规划容易脱离实际,需要动态修正。

3.Agent 反思(Reflection / Self-critique)高级能力 

高级 Agent 增加反思环节: 任务做完(或子步骤失败)后,让 LLM 回头评估:

  • 刚才的步骤有没有错?
  • 有没有遗漏信息?
  • 工具参数是不是不对?
  • 有没有更优路径?

反思结果存入记忆,后续同类任务可以避开坑。

4.主要呈现方式

1.对话式界面:这是最常见的形式,如高级的聊天机器人或AI助手。你在一个聊天框里与它对话,但它背后可以调用各种工具去完成你交代的任务。例如ChatGPT、豆包、千问。

2.自动化流程:这类Agent可能没有直接的用户交互界面,它更像一个在后台运行的脚本。你给它一个初始目标,它就开始“干活”,最终交付一个结果(如一份报告、一段代码、一个数据集)。Auto-GPT和BabyAGI是早期的代表

3.嵌入式助手:Agent被无缝集成到现有的软件中,作为辅助功能出现。最典型的例子就是编程软件中代码生成器的各类插件,它在你的代码编辑器中实时提供代码建议和补全,就像一个‘小助手’。

4.物理实体:当Agent的能力与机器人技术结合,它就有了物理形态。例如,能理解“帮我把桌子上的苹果拿过来”并执行的机器人,其背后的大脑就是一个LLM Agent。

5.多智能体环境:通常以模拟平台或协作平台的形式出现,用于研究和展示多个Agent如何互动。用户可以观察它们的行为,或者作为“上帝”角色设定规则和目标。

5.与传统软件的区别

传统软件

核心要素:软件工程师

机制:通过一系列预定义的指令、逻辑、规则和启发式算法将流程固定下来,以满足软件运行结果符合用户的预期,即用户按照指令逻辑一步一步达成目标

生产方式:人工为中心,AI辅助

AI Agent

核心要素:Agent

机制:将原本由人类主导的功能开发,初见迁移为以AI为主要驱动力。以大模型为技术基础设施,Agent为核心产品形态,变成目标导向的智能体自主生成。

生产方式:AI为中心,人工辅助

声明:本人自学 Java 后端 Agent 智能体的实践产物,参考资料均来自公开可访问的网络资源。如若涉及版权侵权,恳请联系本人,将第一时间进行删除、修正处理。  

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐