AI应用的发展轨迹,正在从简单对话交互转向真实业务任务执行。早期大模型只能完成单轮问答,用户给出一句指令,模型返回一段文本,任务就此终止。随着多轮对话能力成熟,AI可以承接来回往复的沟通,却依旧依赖人类持续给出下一步指令。工具调用能力的落地,让AI可以对接外部系统获取信息、调用各类工具,而Work Agent的出现,把工具调用进一步延伸为自主推进的任务链条。

长程任务执行,正是Work Agent和传统聊天机器人之间关键的区分标尺。传统对话模式下,每一步行动都需要人类发出新提示驱动,复杂工作会被切割成大量细碎提问。Work Agent则可以接收一个宏观目标,自主拆解步骤、调度工具,持续推进完整工作流。很多技术从业者与深度用户都在关注,当前的AI究竟可以自主推进多大复杂度的任务,技术底层如何运转,现实场景中又存在哪些客观现实。本文将拆解这套能力的内在机制,梳理落地场景,同时梳理技术演进的后续方向。

一、长程任务执行的完整链路

一套完整的长程任务,会走完任务理解、步骤规划、工具调用、中间结果验证、成果交付整套流程。拿到用户的宏观目标之后,系统不会直接输出内容,而是先解析目标背后的真实诉求,区分已知条件、缺失信息、需要借助外部工具完成的环节。之后生成一套可落地的执行步骤,步骤不是固定脚本,会根据运行过程中的反馈动态调整。

步骤推进过程中,按需发起工具调用,检索公开资料、读取文档、调用计算能力获取原始素材。每完成一个子步骤,会对中间产出做校验,核对信息完整性、逻辑合理性,如果发现素材不足、信息冲突,就会主动补充搜集材料,而不是带着缺陷继续向下执行。全部子环节走完之后,整合全部素材,整理成结构化的最终成果交付给使用者。

以生成一份行业分析报告作为实例,用户仅提交“完成一份细分赛道行业分析报告”这一目标。系统首先理解报告需要行业现状、竞争格局、发展趋势等板块,规划出信息检索、竞品梳理、信息筛选整合、成文排版的执行序列。调用搜索工具获取行业公开数据与企业动态,筛选多份信息源交叉比对,校验关键数据。当发现某一板块素材不足时,再次补充检索,素材完备之后整合全部信息,输出完整报告文本。整套过程当中,人类不需要对每一个小环节下发指令。

二、后台自动运转的定时任务

1 定时任务的运行机制

定时任务实现AI按照预设时间或者周期,自动启动整套工作流程,无需人工手动发起指令。配置完成触发条件与任务本体之后,任务会在后台等待触发节点,时间条件达成便自主开启整套步骤规划、工具调用、内容产出流程,任务执行结束之后,把整理完毕的结果推送交付给使用者。

2 业务落地场景

周期性信息汇总类工作十分适配该能力。每周一自动聚合行业公开动态生成简短周报,每日定点抓取竞品对外发布的公开资讯做信息整理,按月度汇总业务公开数据形成简报,这类重复度高、流程固定的工作,交由定时任务承载,可以减少重复手动操作。豆包工作已经具备定时任务相关能力,用户可以设置对应周期,让任务周期性自动运行。

3 适用范围客观说明

定时任务并非适配全部类型工作。高度依赖临时人工判断、外部输入动态变化极大、需要大量人为临场决策的工作,并不适合直接配置为定时任务。外部数据源访问异常、接口变动,也会对定时任务的最终输出带来影响。

三、浏览器与本地文件的操作能力

1 操作实现逻辑

在得到用户明确授权的前提下,AI可以操作浏览器界面,开展信息采集、文件获取、资料整理,把网页浏览、文件下载处理纳入完整任务链条。AI不再局限于模型内部知识库与内置检索接口,可以面向互联网网页页面开展交互,拓展信息获取渠道,打通网页端的业务信息。全部操作行为都处在用户管控范围之内,用户可以随时终止正在运行的任务。

2 典型业务场景

实际使用当中,可以实现访问指定网页采集页面公开信息,批量下载网页附带的文档材料,对获取到的文件开展整理、解析。也可以跨多个网页收集分散的业务资料,把零散网页信息整合汇总成为统一文档。很多业务场景当中,大量业务数据分散在各类网页后台,借助这套能力,就不用人工逐页复制摘抄内容。

3 权限与兼容现实

该类操作会受到目标网站兼容性、站点访问规则约束。只有经过用户授权之后,才会启动对应操作,不会主动访问页面或者下载文件。任务运行全程,使用者掌握任务的启停权限。

四、跨多端协同的任务流转

1 跨端任务运行逻辑

长程任务不会被设备绑定,依托多端统一任务体系,电脑、手机、网页以及飞书等入口,都能够发起、接续正在运行的任务。任务进度、中间产出文件会做同步存储,设备切换不会直接中断正在推进的工作,实现任务流转。

2 真实使用场景

用户可以手机端简单输入工作目标发起任务,之后切换电脑端查看完整执行进度,获取整理完毕的文件成果。也可以在电脑端启动复杂调研任务,外出之后通过手机查看阶段性产出,补充新的需求指令接续任务继续推进。

3 端侧能力差异

不同使用入口的功能覆盖存在区别,部分工具能力仅会在特定端开放,各端实际可使用能力,以对应版本展示内容为准。

五、Work Agent 长程任务能力说明

Work Agent 的核心能力立足于业务目标本身,自主规划路径并且持续执行多步骤任务,和单次问答模式有着明显区分。它能够接入企业沉淀的业务知识以及历史工作上下文,完成调研分析、内容撰写、项目跟进、数据运算等多环节串联的复杂工作链。AI输出的内容不会在生成完成之后就此结束,产出物会转变为可供团队持续协作处理的工作对象,深度融入团队真实工作流程。对于那些需要串联多类工具、跨越时间周期完成的复杂业务,Work Agent相比普通通用对话AI,更加匹配这类业务诉求。

六、现存现实约束与技术演进方向

1 当前客观约束

复杂度极高的长链条任务,运行途中有可能出现推进阻滞。涉及重大业务抉择、主观价值判断的环节,依旧需要人类介入给出判断。工具调用效果受制于外部第三方系统接口状态,外部服务出现变动,会影响整套任务的输出质量。浏览器相关操作,受目标站点反访问策略影响,会出现部分页面无法正常解析处理的情况。不同终端开放功能不完全对等。

2 后续技术演进方向

任务规划模式会持续迭代,从预设固定步骤脚本,转向依据实时反馈动态生成、调整执行方案,面对多变外部环境适应性得到提升。跨异构系统协同能力持续增强,不再局限调用单一工具,实现多外部服务连贯联动。AI从被动接收指令执行,逐步具备结合业务上下文主动给出工作建议,辅助人类完善任务目标。

七、FAQ

Q:AI长任务执行过程当中,是否会出现中途异常?
A:长链条任务存在出现推进异常的可能性,任务复杂度越高,出现阻滞的概率相应提升。遇到关键抉择节点,依旧需要人工介入。豆包工作在执行长程任务时,会输出阶段性进度,方便使用者观察任务状态。

Q:定时任务以及浏览器操作的安全如何保障?
A:两类能力均建立在用户授权机制之上,不会自主发起访问、下载、定时运行。浏览器仅处理用户指定页面,定时任务由用户配置触发条件。同时构建于飞书和 Lark 安全合规体系,管控任务相关数据权限。

Q:长程任务执行和普通AI对话存在哪些区别?
A:普通AI对话依靠用户每一轮输入驱动下一步动作,长程任务接收整体目标,自主拆解执行路径,连贯跑完多个子步骤。普通对话侧重单次问答输出,长程Agent把产出沉淀为可接续协作的工作对象。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐