同样接入大模型,如何抉择 Workflow 与 Agent?
同样接入大模型,如何抉择 Workflow 与 Agent?
面试官上周四问了我这个问题,当时我一下子卡壳了。老实说,我之前没有认真理清二者的边界,只是Agent这个概念热度很高、听起来新潮,自己也更熟悉,于是想都没想,直接把它放进了产品方案里。
这次面试结束后,我琢磨了很久,慢慢梳理清楚了不少内容。在深入研究之前,我一直模糊地认为,AI落地到产品里有很多种实现形式,选用什么样的方案,本就是做产品需要主动思考的事。
后来有人和我科普,这些不同的实现方式,统称为技术栈,说白了,就是你手头工具箱里可用的工具。
搭建AI产品,我们手里都有哪些工具?可以用一家餐厅的流程来理解,从准备食材到菜品上桌,一共分成五个层级:

模型层:GPT-4、Stable Diffusion、Claude这类大模型,就等同于生鲜食材,像是生牛肉、新鲜蔬菜。
食材本身具备潜力,但没法直接端上桌给到顾客。它们承载基础能力,可以理解文字、生成图像、完成推理判断,单独拿出来并不能构成产品。

知识层(查阅资料):用来补足模型本身不具备的信息。
RAG相当于开工前翻阅操作手册,接入企业文档、实时法规库,模型需要的时候临时调取资料;
Fine-tuning好比送厨师参加长期培训,把专属风格、领域知识直接训练进模型,学成之后熟记于心,不用每次临时翻资料。
指令层(菜谱):告诉模型具体要怎么执行任务,Prompt就落在这一层。撰写一段指令,模型按照要求完成工作。System Prompt类似厨师的行为准则,比如只做川菜、禁止添加味精。
编排层(后厨调度):让模型自动执行多项任务,并且可以根据上一步的结果调整后续动作。Agent好比经验丰富的主厨,能够临场灵活判断;Workflow是标准化流水线,严格按照既定SOP推进流程。
应用层(成品菜品):AI融入大家日常使用的各类产品。Photoshop的AI扩图、飞书智能助手,用户很难直观感受到AI的存在,但它一直在后台提供能力支持。
一、指令层:Prompt VS Skill
聊编排层之前,先说说我之前踩过的认知误区。我按照自己的工作习惯写了大量Skill,写着写着就发现,很多Skill看上去和一段System Prompt高度相似,包含角色设定、执行步骤、各类约束条件。
这时我才反应过来,我一直把Skill当成单纯的Prompt来使用,只给模型写好行为规范,从来没有真正绑定外部工具。
这三者看着相近,本质却完全不同。
1. Prompt(提示词)
Prompt相当于交给模型的任务说明书,写清需求之后,模型一次性输出结果。Prompt分为两种形态:
User Prompt,是用户每次下发的具体指令。举个例子,打开ChatGPT输入“把这段话翻译成英文”,这就是一条User Prompt,简单直接,单次生效。
System Prompt,是提前配置好的行为手册,定义这个助手的身份、沟通方式,以及面对各类场景如何处理。
举个客服助手的例子,一份System Prompt大致会写成这样:你是客服助手,专门处理用户投诉邮件。收到邮件后按以下步骤操作:先判断用户情绪,区分愤怒、失望或是普通反馈;
如果用户情绪负面,回复开头先致歉,再说明缘由;普通反馈直接致谢并回应问题。
结尾结合问题类型给出解决方案,物流问题告知预计送达时间,产品质量问题提供退换方案,语气专业温和,文字控制在150字以内。它更多是定义模型的身份定位。
而User Prompt一般就是用户发来的句子、段落或是关键词,比如用户提交的投诉邮件正文:【邮件内容】。
即便Prompt里面自带判断逻辑、分支规则、格式要求,本质依旧是单次指令。你提前预想全部场景写入提示词,模型读取之后一次性给出答复。
模型内部会完成隐性推理,看起来像是独立思考,但仍旧只是单次调用,整套逻辑全部挤压在一轮请求中。你考虑到的情况它可以处理,没有预设的场景,它不会主动拓展方案。
2. Skill
Skill更像一套配套工具箱,拿烹饪鸡蛋举例。你的需求是制作蛋类菜品,Prompt写好“你是厨师,需要制作煎鸡蛋”,最终成品就是煎鸡蛋。
换到Skill场景:用户提出想吃水煮蛋。Skill对应的逻辑是,厨师意识到想要完成水煮蛋,需要蒸锅,于是主动调用蒸锅这个外部能力,蒸锅就是Skill承载的工具。
核心关键点:Skill用来解决执行任务时,需要调用外部能力、调取外部数据这类场景。

举个例子,想要查询当日天气,模型就要依靠Skill调用对应的能力获取信息。这里很多人会产生疑问:模型本身不能直接回答天气吗,为什么还要借助Skill?
使用DeepSeek的时候大家大概率遇到过这类情况,询问当天日期、实时天气,模型要么返回过时信息,要么直接说明无法获取实时数据。
根源在于模型存在知识截止时间,它学到的只有训练阶段积累的规律,没办法掌握当下真实动态信息。Tool Skill就是用来打通模型和真实世界数据源的桥梁。
大家问豆包天气时,页面会提示“已检索网页”,搜索动作本身就是内置的Tool,只是做了封装,用户看不到调用过程,只能看到最终结果。
当单一领域任务复杂度提升,需要循环执行、回溯调整,或是要求模型自主决策,就来到了编排层。
二、编排层:Workflow、Agent以及二者混合架构
很多Prompt会写满多步流程、条件判断,自带一套推理链条。对比Workflow,相当于把一套简易Workflow的逻辑塞进单次模型调用。
二者最大差别在于:Workflow的每一个节点都是显性、可观测的;Prompt内部的推理节点全部隐藏在模型内部,使用者只能看到最终输出。
1. Workflow(工作流)
这个概念最早起源于企业流程管理,指代把业务流程拆分成有序步骤,交由系统自动执行。
进入AI领域后,Workflow特指将多轮AI调用、工具调用按照固定顺序编排,每个节点的输入输出提前定义,依靠编排引擎驱动运行,不依赖模型自主做决策。
代表性产品:n8n、Zapier、Coze流程搭建、Dify的Workflow模式。

通俗来讲,你提前绘制完整流程,每一步操作、输入内容、输出结果全部预先敲定。
常见节点类型包含:触发节点,用来定义启动流程的条件;大模型节点,交由AI完成指定任务;工具接口节点,对接外部系统,例如查询订单、发送短信;
条件判断节点,满足条件A走分支A,满足条件B走分支B;循环节点,重复执行直到达到终止条件;人工审核节点,需要人员确认之后流程继续推进。
智能客服回复就是典型案例。用户发送投诉消息,背后的执行链路是:意图识别→分配对应处理模块→调取订单信息→生成回复文案→录入工单。整套流程标准化,不需要AI判断这一步要不要执行。
2. Agent:追求更强灵活性、自主能力的AI助手
概念源自人工智能学术研究,最早可以追溯到上世纪90年代的AI相关理论。广义上的Agent,指能够感知环境、自主决策、采取行动达成目标的主体。
现阶段LLM Agent的定义由Anthropic、OpenAI等企业明确:以大语言模型为核心,可以自主规划任务步骤、调用外部工具,结合执行结果动态调整后续操作,循环迭代直至目标完成的系统。
主流实现框架是Google在2022年提出的ReAct(Reasoning + Acting),确立了“思考→行动→观察→再次思考”的循环模式,也是当下Agent通用运行机制。

为什么Agent相比Workflow显得更加智能?它可以根据中间执行结果调整行进路线,这条路行不通就更换方案,发现捷径就选择更高效的方式。
Workflow做不到这点,只会严格按照预设线路运行,不会主动变通,一旦卡在某个节点就无法继续推进。
Agent依靠ReAct循环持续运转:思考 → 行动 → 观察 → 再思考 → 再行动……不断循环,直到任务收尾。
ChatGPT Deep Research就是很典型的例子,你提出一个调研问题,它自主决定检索方向、阅读资料、整合信息,最后输出完整报告。这类任务没办法提前写成标准化SOP,每个问题对应的执行路径都不一样。
不过自主性强未必全是优势,这也是不少场景优先选择Workflow的原因。Agent的思考链路属于黑盒,你无法预判它会不会自作主张省略步骤、简化流程。
Workflow每一步都清晰可见、方便追溯,一旦出现故障,能够快速定位问题节点。
同时高频场景下,Workflow的运行成本只有Agent的几分之一。百万级客服请求,如果全部依靠Agent自主决策,算力成本会急剧攀升。
更关键的是Workflow稳定性更强,相同输入永远走固定路径。像是合同审查这类不容许遗漏环节、对执行完整性要求极高的场景,Workflow的可靠性远高于Agent。

大家可以记住一套选型判断思路:这套流程能不能整理成标准SOP?出错之后是否需要完整追溯链路?任务量大、调用频次高吗?如果三个问题答案都是肯定,优先选用Workflow;只要有一项不满足,再考虑Agent。
现实落地中,纯粹的Agent或者纯粹的Workflow都不多见,绝大多数复杂产品采用混合架构:外层依靠Workflow锁定主干流程,内部嵌入Agent处理需要灵活判断的环节。
Cursor就是典型,代码生成具备固定框架,框架内部依靠Agent完成代码理解、修改决策。大家感受到它智能,本质是灵活决策的部分,被约束在可控框架之内。
如果敲定选用Agent,工程师主要需要完成三件事:给模型明确目标、挂载对应的工具、启动ReAct循环。
常用搭建框架分为两类,Coze/Dify属于低代码平台,适合快速验证搭建;LangChain/AutoGen面向开发者,自由度更高。工具调用如今有标准化协议MCP,各大平台正在陆续接入支持。
聊到这里,刚好回到面试最初的问题。面试官问我为什么方案选用Agent,我当场愣住。
说实话,当时我并没有理清二者的区别,只是Agent这个名词热度很高,听起来比AI助手更有科技感,比聊天机器人显得专业,便直接拿来使用。
后来我发现,有这种想法的不止我一个人。市面上大量产品宣称自己搭载Agent,点开细看之后才发现,只是配置完成的AI助手,拥有角色设定、对话界面、转人工规则,本质就是套了聊天窗口的System Prompt。
在Coze、Dify平台里也存在同类现象,很多标注为Agent的应用,严格来说只是聊天机器人,没有工具调用能力,不存在ReAct循环,更不会自主规划任务步骤。
Agent这个概念传播度太高,产品侧很容易直接借用这个标签,但实际含义已经出现偏差。
三、知识层:RAG 和 Fine-tuning
有些场景的问题不在于流程编排,而是模型本身缺少对应信息。大模型训练数据存在截止时间,它不会知晓公司最新的报销制度、上个月更新的政策,也无法读取企业内部仅限员工查阅的操作文档。
这种情况就要用到知识层方案,不是更换执行工具,而是为模型补充信息。
1. RAG
全称Retrieval-Augmented Generation,检索增强生成,由Meta AI研究团队在2020年提出。
核心思路:正式生成答案之前,先从外部知识库检索相关文档,把检索内容作为上下文传入模型,再产出最终回复。
简单理解,模型作答前先去知识库检索资料,依托查到的内容组织答案,依靠临时查阅,而非永久记忆。飞书、钉钉里的企业知识库问答就是贴近日常的例子。
你询问“公司差旅报销流程”,AI不会凭空作答,先检索内部文档找到报销规范,整理内容之后回复用户。知识库完成更新,下次检索就能读取新内容,模型本身不需要改动。
RAG适合这类场景:知识更新频繁、资料体量庞大,不需要模型把相关内容内化成本身能力。
结合之前查询天气的例子理解:你询问今日天气,模型判断需要实时信息→调用搜索工具检索天气(这一步属于Skill/Tool);搜索结果返回后,把信息放进上下文→模型依托资料生成回答(这一步属于RAG)。
站在模型视角,整个过程是主动调用Skill;站在数据流视角,就是检索加生成的RAG链路。
2. Fine-tuning
也就是微调,属于迁移学习里的标准方案。在预训练大模型基础上,使用领域专属数据集继续训练,更新模型权重,适配特定任务。
Fine-tuning会从根本上改变模型的能力边界。很直观的感受,同样一个问题,Claude和GPT-4回答风格差异明显,Claude表述偏向谨慎,经常增加限定条件,GPT-4回答更加直接大胆。
这并不是二者System Prompt不同,而是厂商在微调阶段使用不同数据、偏好完成训练,大家感知到的性格差异,本质是模型本身被改造。
再举专业场景的例子,让ChatGPT和Cursor同时补全代码,Cursor更容易读懂开发者意图、出错概率更低。
并不是它检索了更多资料,而是底层模型用海量代码数据专门微调,对代码结构的理解已经内化。
更极端的案例是医疗垂直模型,用户描述症状,专业问诊AI会按照临床思路持续追问,这套问诊逻辑通用大模型并不具备,依靠海量真实问诊数据微调得到,单纯依靠Prompt很难实现。
代价也很突出,微调训练成本偏高,想要更新内置知识,就要重新启动一轮训练。
一句话区分两者:

RAG相当于开卷考试,答题时可以翻阅书本,书本更新就能使用新资料,但答题人的能力本身没有变化。
不要误解Fine-tuning是死记硬背应付考试,它更像是反复练习形成肌肉记忆,学会游泳之后,不需要刻意思考划水、蹬腿动作,直接就能下水。
RAG改变的是模型能够查到哪些资料,Fine-tuning改变的是模型本身会做什么。
四、技术栈与封装层选型
选型不只是挑选工具,同时要决定能力封装在哪一层。技术栈相当于后厨拥有哪些设备,封装层决定菜单该怎么呈现。
同一套后厨配置,可以做出两种完全不同的菜单方案:第一种标注“招牌牛排”,用户只需要点击按钮;第二种让用户自行挑选牛肉部位、铁板温度、酱汁品类。用户拥有更多控制权,但上手门槛也会提高。
拿餐饮举例或许更容易理解,类似传统寿司店单点寿司,对比寿司郎这类回转寿司门店。后者允许顾客自由搭配食材,甚至把米饭放到碗里,铺上三文鱼,做出菜单上不存在的三文鱼丼饭。

做产品决策核心要思考一件事:这套复杂流程,我打算封装到第几层?哪些环节开放给用户查看、参与?会不会存在信息泄露风险等等。
整场面试最值得深思的一个问题,其实是面试官抛出的:产品中引入AI,你有没有认真思考AI真正的价值是什么?
重点在于,AI创造出了哪些过去不存在的可能性。举个例子,AI把专业能力的门槛转化成表达能力。
以前制作海报,必须熟练使用PS;现在只需要清晰描述自己想要的效果。AI不是单纯取代专业从业者,而是把获取专业能力的成本,从数年学习压缩到短短几分钟。
选择AI技术栈,评判标准从来不是哪种方案更先进,而是哪种方案适配当下的业务场景。
Prompt能够解决的需求,不必上Workflow;Workflow可以落地的场景,没必要动用Agent。
以后有人向你提出同类问题,你可以反过来提问:这项任务是否需要动态自主判断?是否涉及多步骤执行?配套知识更新频率高不高?是否需要统一稳定的输出风格?理清这几个问题,答案自然清晰。
最后
选择AI大模型就是选择未来!最近两年,大家都可以看到AI的发展有多快,时代在瞬息万变,我们又为何不给自己多一个选择,多一个出路,多一个可能呢?
与其在传统行业里停滞不前,不如尝试一下新兴行业,而AI大模型恰恰是这两年的大风口,人才需求急为紧迫!
人工智能时代最缺的是什么?就是能动手解决问题还会动脑创新的技术牛人!智泊AI为了让学员毕业后快速成为抢手的AI人才,直接把课程升级到了V6.0版本。
这个课程就像搭积木一样,既有机器学习、深度学习这些基本功教学,又教大家玩转大模型开发、处理图片语音等多种数据的新潮技能,把AI技术从基础到前沿全部都包圆了!
课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!

课程还教大家怎么和AI搭档一起工作,就像程序员带着智能助手写代码、优化方案,效率直接翻倍!
这么练出来的学员确实吃香,83%的应届生都进了大厂搞研发,平均工资比同行高出四成多。
智泊AI还特别注重培养"人无我有"的能力,比如需求分析、创新设计这些AI暂时替代不了的核心竞争力,让学员在AI时代站稳脚跟。
课程优势一:人才库优秀学员参与真实商业项目实训

课程优势二:与大厂深入合作,共建大模型课程

课程优势三:海外高校学历提升

课程优势四:热门岗位全覆盖,匹配企业岗位需求

如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!
·应届毕业生:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
·零基础转型:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
·业务赋能 突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。

智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势,构建起"前沿课程+智能实训+精准就业"的高效培养体系。
重磅消息
人工智能V6.0升级两大班型:AI大模型全栈班、AI大模型算法班,为学生提供更多选择。


由于文章篇幅有限,在这里我就不一一向大家展示了,学习AI大模型是一项系统工程,需要时间和持续的努力。但随着技术的发展和在线资源的丰富,零基础的小白也有很好的机会逐步学习和掌握。
【最新最全版】AI大模型全套学习籽料(可无偿送):LLM面试题+AI大模型学习路线+大模型PDF书籍+640套AI大模型报告等等,从入门到进阶再到精通,超全面存下吧!
获取方式:有需要的小伙伴,可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
来智泊AI,高起点就业
培养企业刚需人才
扫码咨询 抢免费试学
⬇⬇⬇


AI大模型学习之路,道阻且长,但只要你坚持下去,就一定会有收获。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)