多模态与实时交互:语音 Agent 与 Computer Use 的架构分析

多模态与实时交互:语音 Agent 与 Computer Use 的架构分析
前几章构建的 Agent 与世界的交互是轮流的:用户说完一句,Agent 想一段、调用几个工具,再回一句;在它思考的这段时间里,世界被默认为静止的。这个前提如此自然,以至于很少被当成一个假设写出来。然而真实环境不会等模型作出反应:邮件在思考时到达,用户在说话途中插话,页面在两次截图之间已经变了样。本文围绕模态和触发时机两个维度,对 Agent 交互架构的扩展进行技术分析,涵盖异步事件驱动、语音交互范式、Computer Use 以及机器人操作。
两个扩展维度
把观察空间和动作空间摊开,会发现它们各有两个可以扩展的方向:
- 模态决定观察和动作的形式:Agent 是只读文本,还是也能听见声音、看见屏幕、感知力矩;是只能输出 token,还是也能发声、点击、驱动关节。
- 触发时机决定观察和动作的节奏:观察是 Agent 主动去取,还是世界主动推来;动作是必须在一个回合内做完,还是可以跨越回合、中途被打断、被更紧急的事抢占。
| 尺度 | 场景 | 观察侧的变化 | 动作侧的变化 |
|---|---|---|---|
| 秒-天 | 异步与事件驱动 | 会被外部事件主动唤醒的 Agent | 动作跨回合:先发起,后续靠事件收尾 |
| 10 毫秒-1 秒 | 语音 | 边说边听,不等一句说完 | 边想边说,可被打断 |
| 亚秒-秒 | Computer Use | 屏幕在两帧之间持续变化 | 动作后必须重新确认现实是否仍符合计划 |
| 毫秒 | 机器人 | 传感器连续回流 | 动作分块:一次规划一小段,可被抢占 |
异步与事件驱动:当世界主动找上门
核心矛盾:训练同步,部署异步
LLM 的训练范式假设同步——发出工具调用后,下一条消息必须是工具结果。而真实部署要求异步——用户随时可能打断,多个任务可能并发推进,外部事件可能在工具尚未返回时就抵达。这一"训练同步/部署异步"的矛盾贯穿了异步 Agent 架构的所有工程取舍。
事件驱动的异步 Agent 架构不再主动反复检查"有没有新消息"(轮询效率低),而是在新消息到达时自动触发处理逻辑。所有的输入、输出、思考过程和外部交互都被统一建模为事件流。

基于紧急度的三种处理策略
一个 Agent 实例可能同时面对多个事件:用户的新消息、工具返回的结果、定时器到期、另一个 Agent 的协作请求。三种处理策略的区别在于对待安全点的方式:
取消式处理用于紧急事件,主动中断当前步骤,把这一刻变成可以消费新事件的边界。系统停止当前操作,清空待处理队列,将所有事件一次性追加到轨迹末尾,立即重新调用 LLM。这对应于用户在 Agent 执行可能错误的操作时输入"停!我说错了"的场景。
队列式处理用于常规事件,不打断当前操作,等待当前操作完成后将所有事件一次性追加。例如 Agent 调用搜索工具后,用户补充"只看最近一个月的结果",搜索结果返回时两个事件一起呈现给 LLM,避免不必要的往返。
并行处理用于独立的轻量级查询,如"今天天气怎么样"。既不打断主任务,也不让用户等太久,在并行推理会话中独立执行。
工程权宜:模拟同步的异步实现
核心思想是在没有打断发生的常态下,让 LLM 看到标准的同步轨迹,只在打断时才插入占位符来修复格式。有五条关键规则:LLM 输出后立即记录 assistant message;工具调用完成时才记录 tool result;工具执行中的打断需要占位符;LLM 思考中的打断直接丢弃当前思考;非打断事件进入队列等待批处理。
这套方案的核心优势是常态下 LLM 看到的是完美的同步轨迹,最大程度保证了思考质量。但仍存在加剧幻觉的风险:尽管占位符明确说明工具"尚未完成",系统仍可能在后续思考中"编造"一个工具结果,基于虚构的结果做出不恰当的决策。
语音:从级联到全双工的范式演进
语音的价值不只是把文字换成声音。正常说话的速度约为打字的四倍,而且不占用双手与视线,因此它天然适合把 Agent 放进持续工作、随时可能被打断的输入输出回路。
三种交互范式的主线是:如何摆脱"轮流说话"和 VAD(语音活动检测)对发言权的猜测。
| 范式 | 核心结构 | 主要优势 | 主要限制 |
|---|---|---|---|
| 级联 | VAD -> ASR -> LLM -> TTS | 模块清晰、易替换、易调试 | 延迟累积,副语言信息在接口处丢失 |
| 端到端 Omni | 原生音频输入输出,按轮次交互 | 延迟较低,能保留语气、情绪和环境声 | 仍依赖轮次,训练和调试成本较高 |
| 全双工 | 原生音频输入输出,持续听、说和决策 | 支持重叠说话、自然打断和连续流 | 模型训练、控制和评估都更复杂 |
级联流水线及其优化
绝大多数商业语音助手基于串行流水线:VAD 判断用户何时说完,ASR 把音频转成文字,LLM 理解并生成回复,TTS 再把文字念出来。模块化让每个组件可以独立优化,但每一级都可能增加等待时间。

级联方案有三个问题:延迟累积(必须等待一段静音才能确认说完)、信息丢失(有声/无声二值信号无法表达犹豫、情绪和环境声)、上下文被切断(专有名词可能被分片识别而出错)。流式感知是一种保留模块化分工前提下的优化方案:ASR 边听边转,LLM 推测执行,TTS 增量合成,让各阶段尽早产出增量结果。
全双工交互模型
Omni 仍然把对话分成"用户说"和"模型说"两个时段,但同声传译等任务要求两者重叠进行。全双工模型不再预设轮次,而是持续听、持续说,并不断决定继续、停顿、打断或调用工具。Thinking Machines Lab 将这类路线称为交互模型:交互性不再依靠 VAD 等外部 harness 拼装实现,而是内建在模型中。OpenAI 的 GPT-Live 则把全双工路线带到生产规模。
快慢思考分离与端到端统一的取舍
"交互表现"和"智能上限"是两个维度:前台模型要在用户仍然在线时回应,后台模型可以花更多时间思考。三种方案是设计取舍:快思考回应慢思考回答、快思考交互慢思考提醒、端到端思考与表达统一。
快慢分离有一个重要的工程优势:它能直接承接慢模型的迭代红利。前台快模型只负责低延迟地倾听、应答和维持对话,后台慢模型负责推理、规划和工具调用;更强的思考模型发布后,只需替换后台模型,不必重新训练整套实时语音系统。统一路线则把推理与交互绑定在同一个训练周期中,每次升级都要重新兼顾智能水平、响应延迟和表达自然度。
Computer Use:GUI 自动化 Agent
语音把时机轴推到了毫秒级,但它的观察仍是一维的声音流。Computer Use 把同一个问题搬上二维的屏幕:观察变成持续变化的像素,动作变成坐标上的点击与输入。
感知-思考-行动循环
Computer Use 的核心是一个感知-思考-行动循环:Agent 截取当前屏幕画面,多模态模型接收截图和任务指令输出一个具体动作,执行层在真实环境中执行该动作,等待界面响应后再次截图进入下一轮循环。

这里要区分"看懂界面"和"完成任务"。前者更接近多模态理解能力,可以用一次截图问答来测量;后者则要求模型把理解和生成动作放进闭环,处理页面加载、状态变化、误操作和不可逆后果。Computer Use 的难点不只是让模型在截图上答对,而是让它在每一步之后重新确认现实是否仍符合计划。
动作空间设计
Anthropic 的参考实现把完整交互能力分成三类工具:GUI 操作工具(鼠标移动/点击/拖拽、键盘输入、截图等)、命令执行工具(持久 bash 终端会话)、文件编辑工具(基于字符串匹配的安全编辑)。这是一个清晰的动作空间设计,但不是必须遵守的私有协议:只要 Harness 能把同样的截图、动作约束和执行结果转换成目标模型支持的消息与结构化输出,不同模型都可以驱动同一个循环。
视觉定位的三条路线
在循环的每一轮中,模型需要在截图中准确定位目标元素。当前主要有两条思路:
把定位变成选择题:先把界面元素标注好编号,模型只需从中选一个。有两种实现方式——纯视觉标注(Set-of-Mark,用分割模型在像素上切出候选区域)和结构化元素索引(DOM/Accessibility Tree,直接读取界面自带的结构)。后者的优势是把开放式的"在截图中找到按钮并预测坐标"转化为封闭式的"从已标注好的元素中选一个",就像考试中选择题比填空题更容易答对。

纯坐标预测:不做任何标注,直接让模型输出坐标。以 SeeClick 和 Claude 的 computer use 为代表,在海量 GUI 截图和元素位置的配对数据上训练视觉模型,让它学会将自然语言描述直接映射到截图中的精确坐标。模型对坐标的理解高度依赖训练时使用的分辨率,因此需要在工具层实现双向坐标缩放机制。
三条路线的选择逻辑:结构化信息可得时优先用 DOM/Accessibility Tree 索引,定位最精确稳定;不可得时(原生桌面软件、Canvas/WebGL 渲染的界面、游戏)可以用视觉标注或坐标预测。
Computer Use 的世界模型
传统 Computer Use 假设屏幕是静止的——截一张图、想一步、点一下,再截下一张图。可现实里的屏幕会放视频、会弹出转瞬即逝的通知、会播放会议里的人声。观察接口(AOI)通过屏幕关键帧截图、音量门控的语音转写和文字描述画面等技术,把连续的环境观察转换成模型便于处理的离散事件。
更进一步,世界模型让 Agent 能够在行动前预测桌面接下来可能变成什么,从而实现类似于人类的推测执行机制:如果实际变化与预期一致,就沿着原定计划继续执行;只有发现页面状态偏离预期,才停下来重新观察和规划。2026 年 Induction Labs 公布的 Photon-1 展示了这条路线的一种实现,把每帧压缩为离散的潜在 token,自回归预测动作之后的下一状态表示。
移动端的生态壁垒
Computer Use 在移动端面临的主要挑战往往不是技术差异,而是生态壁垒。传统互联网应用的核心变现逻辑是流量与注意力:用户刷信息流时看到广告,浏览页面时产生冲动消费。当 Agent 代替用户操作时,这条变现链路被彻底绕过:AI 不会关注广告,也不会冲动消费,直奔目标完成任务就走。这意味着 Computer Use 面对的不仅是 CAPTCHA 等技术对抗,更是一个结构性的利益冲突。
机器人操作:从仿真到真机
机器人操作比"看图回答问题"难得多。模型不但要看懂画面,还要在真实世界里连续做出动作,而且每个动作都会改变下一刻的情况。
机器人系统通常把不同时间尺度的工作分开:任务目标(分钟级)、长程规划(秒到分钟)、基本技能(约 1-3 秒)、VLA/技能策略(约 1-10 Hz 推理)、底层控制与安全层(约 50-1000 Hz)。这种分工的关键是把"任务顺序"和"眼前动作"分开,否则高层模型的推理延迟会拖慢底层控制。
VLA(Vision-Language-Action)模型接收当前画面和技能指令,输出机器人接下来要执行的动作。但 VLA 有几个局限:训练数据有限(机器人演示远少于互联网文本和图像数据)、只学会模仿不一定懂后果、机器人各不相同、观察可能过时。因此需要世界模型帮助判断"做了之后可能发生什么"。
从仿真环境到真实机器人,并不是再换一种控制器,而是要处理两个环境之间的差异:训练时使用遥操作数据、视频数据或仿真交互数据;部署时同一个物体出现在不同的背景、光照、相机位置和遮挡关系中,机械臂还会遇到不同的摩擦、传感器噪声和执行器延迟。
小结
顺着模态和执行时机两根轴看,异步与事件驱动把观察从"Agent 主动去取"扩展为"世界主动推来",模态没变,变的只有时机。语音把尺度压到毫秒,三种范式的演进主线就是从"轮流说话"逐步走向持续听说。Computer Use 把同一个闭环搬到屏幕上,瓶颈已从"能否完成任务"扩展到操作效率、连续视觉理解和动作后的状态确认。机器人则把它推到物理世界,动作分块在平滑性与反应速度之间取舍,而最终是否完成仍必须由新的观察来判定。
四节共享同一条控制骨架:持续感知、判断当前状态与时机、选择回复或动作、让输出进入环境、观察反馈、继续或修正或重试或停止或重新规划。也共享同一组原语——唤醒、安全点、取消、抢占、快慢分离。这些原语在不同时间尺度上的实现差异,主要由环境变化的速度、动作的可逆性和观察的获取成本决定。
本文内容整理自开源技术书《深入理解 AI Agent》(bojieli/ai-agent-book),采用 Apache 2.0 许可证
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)