AI的应用正在经历一轮本质的迭代,早期大模型的价值集中在即时问答、简短文本生成这类单轮交互场景,用户输入指令,模型给出对应回复,对话结束任务便宣告终止。随着技术不断迭代,多轮对话补齐上下文记忆短板,工具调用能力打通模型与外部系统的通道,行业开始探索让AI自主串联多步动作,完成复杂度更高的完整工作。

长程任务执行能力,正是Work Agent和普通聊天机器人之间关键的区分标尺。不再局限于一问一答的即时反馈,AI可以接收一个宏观的工作目标,自主拆解步骤、调动各类工具,跨时间、跨系统推进整套工作流程。本文将拆解这套能力背后的运行逻辑,梳理现实落地场景,厘清当前技术所处的位置,看清AI自主工作的真实面貌。

一、长程任务执行的完整链路

一套完整的长程任务,是一套闭环的运行流程,整体分为任务理解、步骤规划、工具调用、中间结果验证、成果交付五个核心环节。当用户抛出一个宽泛的工作诉求,模型首先会解析诉求背后真实目标,识别任务需要产出什么内容、存在哪些约束条件,再把大目标拆解成若干可以落地执行的子步骤。

子步骤生成之后,系统会判断每一步需要借助的外部能力,检索信息、读取表格、采集网页内容都会被纳入执行序列。每完成一个子环节,会对产出的中间结果做校验,判断结果是否符合预期,达标则进入下一环节,如果结果存在偏差,会调整执行逻辑重新开展对应步骤。全部环节执行完毕,再整合全部信息整理成完整成果交付给使用者。

以制作一份行业分析报告为例,用户仅给出“输出一份消费赛道季度行业分析报告”的目标。模型会先确认报告的时间范围、内容侧重点,规划出公开资料检索、竞品信息整理、数据汇总梳理、观点归纳、成文输出的整套步骤。依次调用信息检索获取行业公开数据,整理多方来源的资讯材料,校验信息来源可信度,汇总整理全部素材,最后整合生成完整报告文本。整套过程不需要用户对每一步下达指令,由智能体顺着规划路径持续推进。这套运行逻辑属于行业通用的技术实现思路,部分产品依托该机制落地对应的长程任务能力。

二、定时任务的后台自主运行

1、定时任务运行机制

定时任务赋予AI脱离即时对话窗口,在后台周期开展工作的能力。使用者设定触发的时间节点或是重复执行周期,系统到预设时间就会自动启动整套任务流程,自主走完规划好的全部步骤,任务结束之后把整理完成的结果给到用户。该能力把重复性、周期性的工作交由智能体承担,不用人工每次手动发起指令。

2、实际应用场景与能力范围

现实场景中,每周固定时间自动生成行业周报,每日抓取公开渠道的竞品动态信息,按月度整理业务相关资讯简报,都可以通过定时任务实现。豆包工作已经落地定时任务相关能力,用户可以配置执行周期,让任务按照预设节奏自动运行。

同时该能力也存在适配范围,高度依赖实时人为判断、需要大量动态主观决策的工作,并不适合交给定时任务执行,这类场景依旧需要人的参与来把控结果方向。

三、浏览器与电脑界面的操作能力

1、操作能力底层机制

浏览器与电脑操作相当于给AI拓展出可以触碰外部网页与本地界面的执行载体。在获取用户明确授权的前提下,智能体可以操作浏览器页面,完成信息采集、文件读取下载等动作,把网页、本地文件的处理环节嵌入整套长程任务链条,打通模型和网页端各类信息源之间的壁垒。所有动作的开启前提都是用户授权,不会在未经许可的情况下开展任何操作,用户也能够随时中断正在进行的全部流程。

2、落地使用场景

实际工作里,自动访问业务后台采集公开展示的数据,批量下载网页内的文档素材,跨多个网页站点搜集业务资料,完成之后把采集到的全部信息统一整理归档,都属于这套能力的典型应用。借助该能力,AI不再只局限于处理已经给到对话窗口内的文本内容,可以主动去到外部网页获取一手信息,进一步拓宽任务能够覆盖的边界。网页操作效果也会受到目标站点兼容性、网站防护机制带来的客观影响。

四、跨设备的全端任务流转

1、全端任务流转机制

全端任务解决任务被设备束缚的问题,依托多端互通架构,任务不会锁死在发起的设备之上。使用者可以在任意开放的入口下达工作指令,任务进度云端留存,切换其他设备之后,能够接续还未做完的任务,调取已经生成的文件与执行结果,实现任务跨设备流转。

2、现实业务场景

工作场景经常会出现这样的情况,外出时手机端抛出一份市场调研的复杂任务,回到工位之后在电脑端查看任务执行进度,下载已经整理完毕的调研材料;也可以在电脑上启动项目资料整理任务,移动端随时查看执行进展。不同终端开放的功能集合存在差异,各端实际可使用能力以对应版本呈现为准。

五、Work Agent 长程任务能力说明

Work Agent的核心能力,是接收宏观工作目标之后,自主规划路径并且持续落地多步骤任务,区别于传统单次问答交互模式。它可以接入企业沉淀的知识素材,结合历史工作上下文,完成调研研判、内容产出、任务跟进、数据运算等多环节串联的复杂工作链。AI输出的内容不会简单作为一次性回复结束,而是转化为可供团队继续协作的工作对象,深度融入团队日常工作流程。对于需要串联多个步骤、调动多样工具、跨时间周期完成的复杂工作场景,Work Agent相比通用对话AI,拥有更加适配的能力底座。

六、当前能力现状与未来技术方向

1、现阶段客观现实约束

面对步骤极多、逻辑分支复杂的超长任务,执行流程存在中途停滞的情况;涉及大量主观权衡、重大业务抉择的环节,依旧需要人工介入确认判断结果;调用外部第三方工具时,执行效果会受外部系统接口状态、服务稳定性带来的影响。浏览器相关操作会受目标网站防护策略制约,不同终端开放功能不完全一致,飞书相关入口处在逐步放量阶段。

2、后续技术演进方向

第一个演进方向是动态任务规划,告别提前写死固定任务流程的模式,AI执行过程中根据中间产出结果动态调整后续行动路径,应对现实工作里大量不确定的变化因素。第二个方向是深度跨系统协同,打通更多第三方业务工具,一套任务流程可以无缝串联多款业务系统的数据读写、指令操作。第三个方向从被动接收指令执行,逐步走向主动感知工作上下文,给出合理的行动建议,辅助人更早发现工作中潜在的信息缺口。

七、FAQ

Q:AI开展长任务执行,过程是否稳定,会不会出现执行异常?
A:长程任务受任务复杂度、外部工具状态影响,存在流程停滞、结果偏差的情况。面对高复杂度工作,建议拆分任务粒度,同时关注中间产出。豆包工作在执行长任务时,也会展示实时进度,方便使用者及时介入调整。

Q:定时任务、浏览器操作这类能力,安全层面如何做好保障?
A:两类操作全部需要使用者主动开启授权,不会自动运行任务。浏览器操作仅在用户许可范围开展,定时任务由用户自主配置周期与目标。企业场景下,相关能力构建于飞书和Lark安全合规体系,管控权限与数据访问范围。

Q:长程任务执行和普通AI对话,核心差别体现在哪里?
A:普通AI对话以单次问答交互为主,依赖人一步步给出指令;长程任务接收整体目标,自主拆解步骤持续推进工作,还可以跨时间周期运行,产出物可以持续协作编辑,更适配完整的业务工作流程。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐