你好,Agent时代:从ChatGPT到AI Agent,我们正在经历什么
你好,Agent时代
去年这个时候,大家还在讨论Prompt怎么写效果最好。今年再打开朋友圈,满屏都是Agent。
变化来得比预想中快。2022年底ChatGPT刚出来的时候,很多人觉得这不过是个更聪明的聊天机器人,能写文案能润色,顶多算个效率工具。两年过去,事情悄悄起了变化。大模型开始能自己上网查资料,能调用工具,能规划任务,甚至能自己写代码、自己调试。
这个变化不只是多了几个功能。它意味着AI从"你问我答"的模式,正在走向"你给目标,我来完成"的模式。前者是工具,后者是助手。工具需要人一步步指挥,助手能自己想办法把事情办完。
这就是Agent要做的事。
ChatGPT打开了那扇门
先回到ChatGPT刚出来那段时间。
2022年11月30日,OpenAI发布ChatGPT。两个月后,用户数突破1亿,成为人类历史上增长最快的消费级应用。之前这个纪录的保持者是TikTok,用了九个月。
那段时间大家都在玩。让它写诗,让它写代码,让它帮写年终总结,让它模拟各种角色。新鲜劲过去以后,真正开始拿来干活的人发现了几个问题。
第一个问题是幻觉。它说得头头是道,你去查证发现根本没这回事。引用的论文不存在,给出的API参数是编的,连代码里导入的库名可能都是错的。用在创意写作上还好,用在需要准确的地方就很危险。
第二个问题是知识有截止日期。GPT-4训练数据截止到2024年中,之后发生的事它不知道。你问它最近的技术进展、最新的产品价格、刚发布的框架版本,它要么瞎编,要么老实说我不知道。
第三个问题是它不会干活。它能告诉你怎么用Python处理Excel,也能写出代码,但代码要你自己复制到编辑器里运行。它能给你写旅行攻略,机票和酒店还是得你自己订。它停在"告诉你怎么做"这一步,"帮你做"这件事,它做不了。
这三个问题指向同一个方向。大模型很聪明,但它被关在对话框里。它没有眼睛也没有手,看不见外面的世界,也碰不到真实的系统。它能输出文字,文字之外的事情,它做不了。
然后大家开始给大模型装手和脚
最先尝试的是插件模式。
2023年3月,OpenAI推出ChatGPT Plugins。你可以让ChatGPT接入第三方服务,订机票、查股票、点外卖、浏览网页。大模型第一次有了跟外部世界交互的能力。
这个方向是对的,只是插件这条路后来没走通。原因很多,产品形态的问题,安全的问题,开发者生态的问题。但有一件事被验证了。大模型配上工具以后,能力边界会被大幅推开。
几乎同时,一个叫AutoGPT的项目在GitHub上火了。它的思路很简单,你给它一个目标,它会自己拆解任务,自己上网搜索,自己写代码,自己检查结果,一步步往目标靠近。不用人在中间指挥。
那段时间GitHub Trending上全是AutoGPT的衍生项目。星标涨得飞快,几周就破了十几万。大家都很兴奋,觉得通用人工智能好像马上就要来了。
热闹过后,AutoGPT本身没留下来。它太容易跑偏了。让它做个市场调研,它可能会在某个网页上越钻越深,绕不出来。让它写个程序,它可能会陷入反复调试的死循环。任务一复杂,它就管不住自己。
但AutoGPT把一件事讲清楚了。方向是对的,只是实现还很粗糙。大家开始认真研究,怎么让大模型靠谱地完成多步骤任务。这就是Agent这个领域真正起步的时候。
Agent到底改变了什么
说清楚Agent之前,先看看没有Agent的时候,我们怎么用大模型。
没有Agent,你跟大模型的交互是一轮一轮的。你问一个问题,它给一个答案。答案不满意,你再补充说明,它再改。你是司机,它是副驾,方向全靠你把着。
有了Agent以后,你说一个目标,它自己规划步骤,自己调用工具,自己检查结果,遇到问题自己调整。最后把结果交给你。中间你可以不干预,也可以在关键节点插手。
这个变化的核心,是控制权的转移。
之前人负责过程,模型负责每一步的输出。现在模型负责过程,人负责结果。你不用告诉它第一步做什么第二步做什么,你只需要告诉它你想要什么,以及做到什么程度算合格。
这件事为什么重要。因为它改变了人和AI的协作方式。以前AI是计算器,你输入算式它出结果。现在AI慢慢变成实习生,你交代任务,它自己想办法完成,遇到拿不准的再来问你。
计算器和实习生之间的差距,就是Agent要填补的空间。
现在的Agent发展到哪一步了
说几个我觉得有代表性的进展。
代码领域走得最快。GitHub Copilot从补全代码进化到了Copilot Workspace。你描述一个需求,它能自己打开仓库,理解代码结构,写出实现,跑测试,甚至自己改bug。Devin这类AI软件工程师产品,已经能独立完成一些简单的开发任务了。
数据分析领域也很活跃。你用自然语言问一个问题,Agent会自己去查数据库,写SQL,跑分析,生成图表,最后给你一份结论。不用再等数据分析师排期。
客服和知识库是落地最多的场景。企业把自己的文档和产品资料喂给RAG系统,用户提问时,Agent先去知识库检索相关内容,再组织语言回答。准确率比纯大模型高很多,也不会胡说八道。
这些应用有一个共同特点。它们都给Agent划定了明确的边界,不让它自由发挥。能做什么,不能做什么,出了问题怎么办,都有设计。自由探索的AutoGPT没跑通,约束边界的行业应用先落地了。
这也是我做这个专栏的一个基本判断。Agent的价值不在全能,在特定场景下的可靠。把一件事做好做稳,比什么都能做但什么都做不好有价值得多。
这个专栏会写什么
这个专栏叫AI Agent企业级实战。名字里有两个关键词,企业级和实战。
企业级的意思是,我们不做玩具Demo。我们讨论的是真实业务场景里会遇到的问题。知识库不准怎么办,工具调用出错怎么恢复,用户数据怎么保护,成本怎么控制,上线以后怎么监控。这些问题Demo里不用考虑,真实项目里一个也绕不过去。
实战的意思是,每一篇都有可运行的代码。不聊空泛的概念,不画漂亮的架构图然后告诉你"具体实现留作练习"。每一篇文章结束,你手里都会有一个能跑起来的东西。
整个专栏60篇,分成八个模块。
筑基篇讲认知和基础概念,帮你建立对Agent的完整理解。工具篇讲怎么让Agent拥有各种能力,搜索、数据库、文件处理、API调用。RAG篇是重点,讲怎么给Agent装上知识库大脑,这是目前落地最成熟的方向。
记忆篇讲怎么让Agent记住用户和历史。LangChain和LangGraph两篇讲框架的深度使用。多智能体篇讲怎么让多个Agent协作完成复杂任务。最后部署与工程化篇,讲怎么把Agent从Demo变成可以上线的产品。
如果你跟着学完,应该能独立完成一个企业级Agent项目的设计、开发和上线。
写给谁看
这个专栏适合几类人。
第一类是已经会Python、用过几次大模型API,想系统学习Agent开发的程序员。你可能零散看了一些教程,但总觉得拼不起来,不知道怎么做出一个完整的东西。
第二类是想转行做AI应用开发的技术从业者。你可能做过后端、做过前端、做过测试,想抓住这波AI浪潮,但不知道从哪里切入。
第三类是产品经理和技术管理者。你不需要亲手写代码,但需要理解Agent技术的边界和可能性,才能做出正确的产品决策和技术选型。
第四类是AI训练师和数据从业者。你已经在AI行业里了,想往应用开发方向走一步,拓宽职业路径。
不管你是哪一类,这个专栏的要求只有一个。你要有基本的Python编程能力,能看懂代码,能自己动手跑。光看不动手学不会Agent开发。
最后说一句实在话。
Agent这个领域现在还很早。框架在变,模型在升级,最佳实践还没有完全成型。今天你学到的某个API,可能半年以后就有了更好的写法。今天你觉得很合理的架构,再过一年可能就过时了。
这不是坏事。正因为早,现在入场的人才能享受早期红利。等一切都成熟稳定了,机会也就没那么多了。
这个专栏会尽量写"道",少写"术"。原理和思路比具体的API调用更重要。框架会换,工具会变,理解了底层的东西,换什么你都能快速跟上。
我们从下一篇开始,从零讲起。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)