Agent(智能体)到底是什么

Agent(智能体/智能代理)是具备一定自主性的人工智能系统,能够感知环境、做出决策、采取行动

一、四大核心特性

  1. 自主性:无需人类直接干预,可以独立做决策、执行行动;
  2. 适应性:可以学习、适应环境变化,持续提升自身能力;
  3. 交互性:能和人类或者其他Agent对话交互,理解自然语言;
  4. 功能性:可以在特定领域完成具体任务,比如数据分析、自动办公、自动驾驶等。

简单理解:普通大模型是“被动问答工具”,你问一句,它答一句;Agent是会自己思考规划、主动干活的AI

二、Agent的4个硬件/软件核心组件

  1. 感知器:接收外界信息(网页、数据库、传感器、用户提问);
  2. 知识库:存储环境信息、历史经验记忆;
  3. 决策引擎大模型就是Agent的大脑,分析信息,推理、做决策;
  4. 执行器:对外执行动作,虚拟动作(调用API、发消息),物理动作(机器人运动)。

三、现代大模型Agent四大要素(Lilian Weng架构)

  1. 规划Planning:拆解复杂子任务、思维链思考、自我反思纠错;
  2. 记忆Memory:短期记忆(对话上下文)、长期记忆(向量库存储历史经验);
  3. 工具Tools:调用搜索、计算器、代码解释器、各类API,弥补大模型本身知识与能力局限;
  4. 执行Action:按照规划调用工具、和外部环境交互,完成任务目标。

经典工作循环:ReAct(思考Thought →行动Action →观察Observation)

  1. 思考Thought:大模型分析任务,想下一步该干什么;
  2. 行动Action:调用工具(搜索、计算等);
  3. 观察Observation:拿到工具返回结果;
  4. 循环上面步骤,直到任务完成,输出最终答案。

四、通俗举例

  1. 旅行Agent:不只是给旅游攻略,还可以读取你的预算、偏好,自己去查航班、比价,自动订机票酒店
  2. 办公Agent:接收需求,自己搜索资料、调用代码生成PPT;
  3. 自动驾驶Agent:感知路况→决策加速/刹车→控制车辆行驶。

五、和普通大模型的区别

  • 普通LLM:接收提问→直接输出答案,不会主动做事,不会调用外部工具,不会拆解多步任务
  • Agent:接收一个目标,自己拆任务、选工具、循环执行、反思纠错,直到完成目标

六、技术实现现状

现在主流构建Agent的工具:OpenAI Assistants API、LangChain、LlamaIndex、MetaGPT。

老一代AI(符号AI、强化学习Agent)泛化很差;大模型崛起,才真正让通用Agent成为可能,给Agent带来强大推理、理解自然语言的大脑

七、相关面试题(贴合真实业务面试,包含参考答案,分基础、中等、拔高)

一、基础题(概念理解)

1. 请你讲讲什么是Agent?Agent有哪几个核心特性?

参考答案
Agent(智能体)是拥有一定自主性的人工智能系统,核心是感知环境、做出决策、采取行动,不再只是被动回答问题。
四大核心特性:

  1. 自主性:不需要人每一步指挥,独立做决策执行任务;
  2. 适应性:可以学习,根据环境变化调整行为;
  3. 交互性:能和人或者其他Agent进行自然语言交互;
  4. 功能性:面向特定业务完成具体任务。

区分普通大模型:普通LLM被动接收提问输出答案;Agent接收目标,自主规划、调用工具完成整套任务。

2. 在大模型出现之前就已经存在Agent技术,为什么说大模型才让Agent迎来爆发?

参考答案
大模型之前有符号Agent、反应型Agent、强化学习Agent:

  1. 符号Agent:依赖人工写规则知识库,遇到知识库以外问题直接失效;
  2. 反应型Agent:只能简单响应,缺少复杂规划推理;
  3. 强化学习Agent:训练样本需求量巨大,泛化能力弱。

大模型充当Agent的大脑,带来关键能力:
① 自带海量世界知识;②强大自然语言理解;③通过CoT、ReAct实现任务推理拆解;④零样本/少样本泛化,陌生任务也能处理。让Agent可以听懂人类自然语言指令,不需要大量人工编写规则。

3. Agent的感知力、行动力分别指什么?

参考答案

  • 感知力:Agent获取外界信息的能力。包含语言交互能力(理解人类对话)、多模态能力(处理图片、音频等多种信息)。
  • 行动力:Agent对外界产生作用的能力。语言输出是基础前置能力;核心是工具调用能力,分为软件层面调用API、代码;物理层面就是具身智能,操控机器人等硬件实体,和真实物理世界交互。

二、中等难度(业务场景题,社招、AI产品/LLM开发高频)

4. 结合业务场景,说说Agent和普通RAG聊天机器人的核心区别?举一个真实业务例子。

参考答案
普通RAG问答机器人:被动模式,用户提问→检索知识库→返回答案,不会自主规划,不会主动调用多个工具完成多步骤任务。
Agent:接收一个总目标,自主拆解子任务、选择工具、循环执行直到完成目标

业务示例(鲜花电商场景,来自书本案例):

  • RAG机器人:只能回答“XX花多少钱?”“怎么配送?”这类单条问题;
  • Agent智能体:接收目标:“根据我的预算,给女朋友挑一束花,并且完成下单预约明天下午送达”
    Agent自主做:①解析用户预算;②检索鲜花库存;③筛选符合预算花束;④读取配送规则;⑤调用下单接口,预约配送时间,整套流程自主完成,不需要用户一步步提问。
5. 现在很多企业想落地Agent,书中提到Agent优先改造现有业务流程,而不是创造全新业务,谈谈你的理解,举2个行业例子。

参考答案
Agent现阶段技术还没完全成熟,从零创造全新商业模式风险很高。把现有业务流程自动化、增强,更容易拿到业务收益。
例子1:办公行业:原有工作是收集资料、写报告、做PPT;Agent接手这套流程,自动搜集资料、生成PPT,改造原有办公流程,不是凭空创造一种全新办公模式。
例子2:客服行业:原有客服工作是接待咨询、查询订单、处理简单售后;Agent接管这套流程,7×24小时处理咨询,查询订单接口,直接处理简单售后,改造传统客服业务。

6. 什么是具身智能?现实中有哪些落地方向,会带来什么挑战?

参考答案
具身智能指Agent拥有物理实体,能够直接和真实物理世界交互,不局限在软件、网络世界。
落地:工业机器人、服务家政机器人、自动驾驶。
挑战:不仅要AI理解逻辑,还要感知物理环境,掌握物理世界规律;同时涉及安全风险,需要保障和人共处时的安全性。

三、拔高/开放性面试题(高级开发、AI产品、技术分享,考察思考深度)

7. 虽然Agent概念很火,但是成熟大规模商业产品还不多,结合Gartner技术成熟度曲线分析,为什么?未来会面临哪些风险?

参考答案
Gartner曲线阶段:Agent处在期望顶峰向失望低谷过渡阶段
原因:行业对Agent期望值很高,但现实技术有瓶颈:大模型推理不稳定、工具调用容易出错、记忆管理难。期望很高,但落地效果达不到预期。

风险:

  1. 业务风险:Agent自主做决策,如果无人监管,错误决策会造成业务损失;
  2. 安全风险:有可能被构建恶意Agent,执行破坏行为;
  3. 伦理风险:自主性变强,需要对齐人类价值观,要做好AI治理监管。
8. 什么是多Agent协作?设想一个企业内部的多Agent协作真实业务场景。

参考答案
多Agent协作:多个具备不同专长的Agent,互相通信、分工协作,共同完成复杂大任务,分为高层Agent负责整体规划,底层Agent执行细分任务。

企业办公场景示例:做一份市场调研报告

  1. 总控Agent:接收目标“输出鲜花行业市场调研报告”,拆解任务;
  2. 搜索Agent:负责搜集行业公开数据;
  3. 数据分析Agent:处理统计数据,生成图表;
  4. 文档Agent:整合全部内容,输出完整报告。
    各个Agent互相传递信息,分工完成单Agent很难搞定的复杂任务。
9. 请说说Life3.0这个概念,它和Agent是什么关系?

参考答案
Life1.0:硬件软件全部靠生物进化,比如细菌;
Life2.0:硬件无法改变,但软件(知识思想)可以后天学习,对应人类;
Life3.0:生命体可以自主设计自身软件,未来还可以改造硬件,是AI的远期愿景。
Agent是迈向Life3.0的关键载体,现阶段的Agent只是初级形态,距离真正Life3.0还有非常遥远距离。

四、简答题(可以用于笔试)

  1. Agent四大组件是什么?

感知器、知识库、决策引擎(大模型)、执行器。

  1. Agent两大能力是感知力和?

行动力。

  1. Gartner技术成熟度曲线5个阶段:____

创新触发点、期望顶峰、失望低谷、启蒙斜坡、生产力高原。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐