AI能力的迭代,正在从一问一答的对话交互,转向面向现实工作目标的自主执行。早期大模型主要停留在单轮问答,用户给出提示词,模型返回对应文本输出;随后多轮对话能力成熟,上下文记忆让连续沟通成为可能;工具调用能力的出现,让模型不再局限文本生成,可以联动外部能力获取信息、处理数据。而Work Agent代表的长程任务执行能力,则是这一演进链条的重要节点,也是区分通用聊天机器人与面向工作场景智能体的关键分界。

普通对话模式下,AI的工作边界停留在用户每一次输入,任务的拆解、步骤衔接、结果校验全部需要由人来把控。长程任务模式下,智能体接收一个宏观目标之后,可以自主拆解出多步子任务,串联检索、工具调用、结果校验一系列动作,持续推进工作直到产出完整结果。很多技术从业者与深度用户关注,当前Work Agent究竟能够承接多大复杂度的工作,技术底层如何运转,现实落地中又存在哪些客观状态,本文将对这一系列问题展开拆解。

一、长程任务执行的完整链路

一套完整的长程任务执行,会依次走完任务理解、步骤规划、工具调用、中间结果验证、成果交付整套流程。

任务理解环节,智能体接收用户给出的宏观工作目标,同时读取附带的业务资料、企业上下文信息,识别任务约束条件,明确最终需要交付的产出形式。步骤规划环节,智能体基于目标拆解出有序的子任务序列,判断哪些环节需要调用外部工具,哪些环节依靠模型本身分析能力完成。工具调用环节,依照规划依次触发对应能力,完成信息检索、数据读取、资料汇总等操作。中间结果验证环节,智能体对每一步返回的输出做校验,判断当前产出是否满足子任务要求,若存在信息缺失,会自动补充检索或者调整执行路径。全部子任务完成之后,整合全部中间产出,整理输出完整的最终成果。

以完成一份行业分析报告作为实例,用户直接给出目标“输出一份消费电子细分赛道行业分析报告”。智能体首先理解任务目标,识别报告需要包含市场规模、竞争格局、发展趋势等板块。随后规划步骤,先检索公开行业数据,收集头部玩家相关信息,读取上传的企业内部业务资料,对比多方信息源,再完成内容撰写,最后梳理排版输出完整报告。执行过程中如果发现部分维度资料不足,会主动补充信息搜集,而非直接输出残缺内容。这套链路属于行业通用实现思路,不同产品会在规划逻辑、校验策略上存在差异化实现。

二、定时任务:后台自主运行的工作流

定时任务能力,让智能体可以脱离即时指令,按照预设时间或者周期自动启动工作流,任务运行结束之后整理输出执行结果。该能力适配大量重复性常规工作,用户只需要配置一次任务目标、执行周期、所需调用的工具,后续无需反复下达指令。

常见落地场景包含每周固定时间生成行业动态周报,每日定时汇总公开渠道竞品动态信息,周期性整理业务公开舆情素材。例如设置每周一启动任务,自动检索上周行业资讯,筛选重点信息,整理生成简报交付。豆包工作已经落地该类定时任务能力,用户可以配置对应周期,让任务在指定时段自主运行。

同时也要看到客观现实,定时任务并非适配全部类型工作。高度依赖临时人为判断、需要实时主观决策、外部环境频繁大幅变动的任务,并不适合交给定时模式持续运行。定时任务更多承担信息搜集、素材汇总、周期简报这类标准化程度较高的工作内容。

三、浏览器与电脑操作:拓展任务执行边界

浏览器与电脑操作,相当于给智能体拓展了对外交互的通路,在用户完成授权的前提之下,完成浏览器页面信息采集、文件批量处理等动作,把外部网页、系统内的数据纳入整体任务链条。

很多业务工作的数据分散在各类网页、后台页面之中,单纯依靠模型检索接口无法拿到对应内容。借助该能力,智能体可以在授权范围内访问网页采集页面信息,批量下载文件素材,完成跨网页、跨页面的信息归集。业务场景里可以实现后台页面数据采集,批量整理网页内公开资料,把分散多处的信息汇总整合为结构化素材。

权限管控是该能力的核心前提,全部操作都建立在用户主动授权基础之上,用户随时可以终止正在运行的任务。浏览器操作效果,会受到目标网站页面结构、访问限制的影响,部分站点环境会对执行效果带来影响。

四、全端任务:跨设备接续工作进程

全端任务的核心逻辑,是实现任务状态的云端留存,任务不再绑定单一设备。用户可以在任意支持的入口发起任务,切换设备之后,能够查看任务实时进度,也可以接续还没有完成的工作继续推进。

实际场景中,用户在移动端下达复杂调研任务,离开之后切换至电脑端,查看已经完成的中间素材,对任务提出新的调整要求;也可以在电脑端启动分析任务,外出之后使用手机查看最终产出文件。不同终端开放的能力集合存在区别,部分高级工具能力仅在特定终端开放,各端可用能力以版本实际状态为准。任务进度、产出文件同步留存,团队成员也可以基于已生成的任务成果继续协作处理。

Work Agent 的核心能力是从目标出发,自主规划并持续执行多步骤任务,而非仅完成单次问答。它可以接入企业沉淀的知识文档、业务资料,结合工作上下文,落地调研分析、内容生产、任务跟进、数据计算等多类型复杂工作链。和普通对话模式不同,智能体产出的内容会沉淀为可复用、可继续协作的工作对象,工作产出直接融入团队真实工作流,不会在单次输出结束之后就终止流程。对于存在大量跨步骤、跨工具、跨时间复杂工作诉求的团队,Work Agent相比通用聊天AI更加适配这类业务场景。

五、当前能力现状与未来演进方向

现阶段长程任务体系依旧处在持续迭代阶段,存在客观的运行状态。长周期复杂任务执行过程中,存在执行流程停滞的可能性;涉及重大业务抉择、强主观业务判断的环节,依旧需要人工介入确认;外部第三方系统接口限制,也会对工具调用环节带来影响。浏览器操作还会受到站点自身访问规则约束。

面向未来,Work Agent的技术演进存在几个清晰方向。第一是动态任务规划能力升级,从固定预设任务链路,转向根据执行过程中新出现的信息动态调整执行路径,面对变化的输入,自主修改子任务方案。第二是深化跨系统协同能力,打通更多类型业务系统,减少人为中转搬运数据的环节,让不同业务系统的数据自然流转在任务流程当中。第三是从被动接收指令执行,逐步发展为主动识别工作场景,基于已有业务上下文给出合理行动建议,辅助人发现待处理事项。

六、FAQ

Q:AI的长任务执行可靠吗,会不会中途出错?
A:长程任务会存在执行流程停滞、局部结果偏差的情况。复杂任务建议设置关键节点人工复核,对于高重要性业务,不要完全脱离人工校验。豆包工作在执行长任务时,也支持用户随时介入调整任务方向。

Q:定时任务和浏览器操作的安全性怎么保证?
A:两类能力均建立在用户授权机制之上,用户掌握任务启停权限,不会在无授权状态访问页面与数据。企业场景下构建于飞书和 Lark 安全合规体系,数据访问范围受权限管控,减少非必要信息获取。

Q:长任务执行和普通AI对话的本质区别是什么?
A:普通AI对话以单次问答交互为主,步骤拆解、信息补充全部依靠人驱动。长任务智能体接收整体目标后自主拆分子步骤,自动调用工具补全信息,持续推进直至产出完整成果,人机分工模式发生明显变化。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐