AI Agent的本质:不只是聊天,而是会做事的智能体
近年来, 成为人工智能领域热门话题的AI Agent, 直译为“智能体” , 然而, 很多人对于它的理解依旧停留在“更聪明的聊天机器人”此项层面, 实际上, AI Agent是一类代表着截然不同技术路径以及应用范式的存在, 它并非单纯被动回答问题, 而是会主动感知所处周边环境, 并且据此规划相关行动, 进而完成既定任务。
什么是AI Agent
作为智能系统的AI Agent, 其核心定义在于, 它是那种能够在环境里感知信息的, 能够自主进行决策并通过对采取行动的执行来达成目标的。这与那些传统的AI程序存在着本质方面的区别, 可以这么说传统的AI系统一般呈现的是诸如“输入什么内容它就输出怎样的结果” 的被动模式, 然而Agent它具备着包含任务的分解、对工具的调用以及结果反馈的闭环实际能力的。
以一个简单的例子, 可助力理解差异, 传统聊天机器人, 当被问及“帮我预订明天的航班”时, 仅能去提供航班信息或者是建议, 然而AI Agent却能够接入订票系统, 进而查询实时数据, 接着完成预订操作, 随后将结果反馈给用户, 这个“会做事”的本领, 即是Agent的核心特征。
Agent的技术架构
现代AI Agent通常由四个核心模块构成。
负责接收外部环境信息的感知模块, 所接收外部环境信息涵盖文本、图像、语音或者结构化数据。规划模块当属大脑部分,是基于大语言模型来进行任务分解以及决策生成的。负责调用工具或 API 完成具体实例操作的执行模块, 比如搜索、计算、代码执行等操作。记忆模块被划分为短期记忆和长期记忆, 短期记忆用来存储当前任务的上下文信息, 长期记忆用于跨会话的经验积累。

这四个模块构成闭环, Agent感知环境之后, 规划模块去制定行动计划, 执行模块进而采取行动, 此行动结果反馈给记忆模块, 记忆模块据此再去指导下一次行动, 如此这般的迭代过程让Agent得以处理复杂且多步骤的任务。
Agent的能力边界
Agent的能力是建立于多个技术基础之上的, 大语言模型给予了强大的自然语言理解以及生成能力, 而这是Agent规划决策的基础所在, 工具调用能力致使Agent能够突破自身知识范围, 凭借外部资源去完成任务, 推理技术像思维链和树搜索助力Agent处理复杂逻辑问题。
不过, Agent可不是无所不能的。按照技术评估数据来看, 当下Agent在开放域任务方面的成功率大概是60%至75%, 在结构化任务里的表现更为出色, 能够达到85%以上。关键原因在于, Agent的规划能力被模型自身的理解深度所限制, 碰到超出训练数据范畴的新问题之时, 就容易产生看起来合理但实际上错误的方案。另外, 工具调用的准确性也会直接对最终结果产生影响, 错误调用或许会引发不可预期的后果。
应用场景与市场现状
Agent的应用, 已经从实验室迈向了产业实践, 在企业端, 客户支持、数据分析以及代码开发, 是最为成熟的三个领域, 据行业统计, 2024年全球AI Agent市场规模大概是50亿美元, 预计到2030年将会超过300亿美元, 年复合增长率大约为35%, 这个增长主要源自企业对于自动化流程的迫切需求。
对于个人用户端而言, Agent的应用呈现相对分散的状况, 其应用情形首先是主要集中于日程管理场景, 其次是信息整合场景, 再者是个性化推荐等场景。用户接受度方面, 因使用习惯而受到较大影响, 在初期阶段, 需要较多的引导以及配置。

在技术厂商当中, 、、微软等这些巨头, 都在Agent方向投入了诸多资源。的GPT - 4 Turbo引入了函数调用能力, 以此为Agent的应用奠定了基础, 的系列强化了对多模态的理解以及工具的使用。国内的厂商, 像百度、阿里、字节跳动也都纷纷相继推出了Agent相关产品。
面临的挑战
Agent技术的发展, 依旧面临着好些挑战。安全问题, 是首要被关注的点。Agent有自主执行的能力, 一旦行为失去控制, 就可能导致数据泄露、系统损坏等这类后果。当下主流的方案, 是借助权限控制以及人工审批, 来对Agent的行动范围加以限制, 然而这样在一定程度上, 削弱了自动化的效率。
成本方面的问题同样是不能够被忽视的存在, 每一回Agent任务的执行, 都极有可能关联涵盖数十甚至于上百次的模型调用行为, 如此之下, 所产生的计算成本要远远高于传统的用于沟通对话的系统设置, 在涉及到需要进行高频使用的应用场景环境当中, 成本所衍生的压力, 显得越发显著突出。
技术瓶颈领域, 复杂任务给以分解仍然是难点所在, 当任务步骤超出五个的时候, Agent的错误累积概率显明地提升, 研究表明, 任务步骤每增添一步, 成功率平均降低大约8%, 这需求更为先进的规划算法以及更强的推理能力。
正处于快速演进时期的是Agent的发展, 未来的改进方向涵盖着更高效的规划算法, 还有更精确的工具调用, 以及更强的安全约束机制, 随着硬件算力得到提升, 并且模型迭代加速, Agent的应用场景将会持续扩展。
基于技术层面来瞧一瞧, Agent意味着通用人工智能里关键相当重要的探索途径。它把AI从仅仅只是“知识存储”的状态朝着“问题解决”去推进, 从纯粹“被动响应”的模式扭身转变为“主动行动”的动态。尽管当下依旧是存在着好多好多的局限之处, 然而就算这样它的发展潜力业已获得了行业范围之内广泛的认可。对于那些投身从事相关工作的人员来讲, 弄明白搞清楚Agent的本质以及相应的技术方面的所奉行的道理原则准则, 能够有益于更出色地去抓住掌好这一领域范畴之内出现出现的机会。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)