19-多模态与实时交互:语音Agent(级联到全双工)、Computer Use与机器人操作VLA

前面聊的 Agent 大多在"打字",而真实世界的人机交互是"看、听、说、动"。这一篇讲 Agent 的三张新面孔:语音交互、GUI 操作(Computer Use)和机器人操控(VLA)——它们对应着无人零售场景里最刚需的三件事:语音客服、自动巡检后台、理货机器人。

一、语音:最自然也最难啃的人机接口

语音输入速度约为打字的 3 倍,且解放双手双眼——对站在售货柜前、拎着东西的顾客来说,"说一句"远比"戳屏幕"自然。但语音的难点在于实时性:人对话的应答间隔低于 800ms 才感觉自然,超过 2 秒就开始尴尬。而 LLM 一次推理动辄数秒,这个矛盾催生了交互时序的范式演进。

二、三个范式:从级联到全双工

范式一:级联流水线(ASR → LLM → TTS)

最经典的架构,三段接力:

麦克风 → ASR(语音转文字)→ LLM(理解+决策)→ TTS(文字转语音)→ 扬声器
  • 优点:每个环节可独立选型和优化,LLM 可以随便换,工程可控性最好;
  • 缺点:延迟叠加。三段串行,每段 300~800ms,总延迟轻松破 2 秒;且信息有损——ASR 把语气、迟疑、情绪全丢了,LLM 听到的是"文字僵尸"。用户说"好——吧——“,文字都是"好吧”,但语义天差地别。

工程优化手段:流式 ASR(边说边转)、LLM 首 Token 流式输出、TTS 分句合成边生成边播。我们的售货柜语音客服第一版就是级联架构,优化到端到端 1.5 秒内,日常问价、故障报修已经够用。

范式二:端到端全模态模型(Omni)

把语音直接喂给多模态模型(如 GPT-4o 这类 Omni 架构),音频 token 和文本 token 在同一个模型里处理,直接输出语音。

  • 优点:保留副语言信息(语气、情绪、背景音),延迟环节减少;
  • 缺点:模型贵、定制难,输出语音的"可控性"(比如强制播报合规话术)不如级联方案。

范式式三:全双工交互(边听边说)

人类对话是全双工的——你在说话时我也在听,随时可以打断你、接你的话茬。全双工模型让 Agent 同时进行听与说,核心能力有两个:

  1. 打断处理:用户说"等等,我说的不是这个",Agent 要立刻停住、消化新输入、调整回应——而不是把剩下半句念完;
  2. 轮次决策:模型实时判断"现在该说还是该听",不再依赖"用户停顿 = 说完了"这种脆弱的 VAD(语音活动检测)启发式。

售货柜场景的全双工价值很具体:老年顾客说话慢、停顿多,级联方案经常在人家说到一半时抢答,全双工能显著降低"被打断感"。

三、认知时序:实时交互与深度思考的权衡

全双工要求"快思考",但复杂问题需要"慢思考"。矛盾怎么解?答案是分层

  • 快通道:小模型/全双工层处理应答、确认、寒暄(“好的您稍等”);
  • 慢通道:复杂查询(“上个月这台柜子哪些商品卖得最好”)转给深度推理层,快通道先说"我帮您查一下",给用户一个"正在处理"的心理锚点。

这和人接电话说"我想想啊"是一个道理——用廉价的实时反馈掩护昂贵的深度计算

另外,语音合成的"像人"也不只是音色问题:情感(歉意/确认/歉疚场景用不同语气)、韵律(重音、停顿、语速变化)决定用户是否愿意听下去。TTS 正从"能听清"进化到"听得舒服"。

四、Computer Use:让 Agent 操作图形界面

让 Agent 像人一样"看屏幕、点鼠标",就是 Computer Use(GUI 自动化 Agent)。它的价值在于:大量存量系统没有 API,只有界面——无人零售的运营商后台、财务系统、各类管理控制台,不可能全为 Agent 重写接口。

核心技术拼图

  1. 动作空间设计:把 GUI 操作抽象为最小动作集——点击(x,y)输入(text)滚动快捷键。动作空间太大(每个像素都可点)或太碎(组合动作不可分)都会导致学习困难,实践中用截图坐标 + 元素定位混合表示。
  2. 视觉定位(Grounding):看到"补货按钮"四个字和真正算出它的像素坐标 (873, 412) 是两回事。Grounding 是视觉语言模型把"语义指代"落到"屏幕坐标"的能力,是 Computer Use 的 accuracy 瓶颈所在。
  3. 看动画、听声音的 Agent:纯截图 Agent 是"睁眼瞎拍照片",对加载动画、操作反馈音无感知,容易在页面未加载完成时狂点。进阶方案引入界面动态信息(DOM 变化事件、系统音效),让 Agent 知道"点了之后系统有没有响应"。
  4. 世界模型:让 Agent 在心里维护"界面状态机"——当前在哪个页面、哪些操作可用、点了会发生什么。有世界模型的 Agent 能预判"这个按钮点了会弹确认框",规划就不再靠试错。

移动端生态壁垒

安卓有 Accessibility Service 可读取控件树,iOS 却对自动化近乎关门——无障碍 API 的使用受政策限制,厂商把自动化能力视为安全红线。所以移动端 Agent 普遍走云真机 + 视觉方案或厂商合作通道,壁垒比桌面端高得多。这提醒我们:Computer Use 的技术可行性受生态制约,选型时先看目标平台的"政策地形图"。

五、机器人操作:XLeRobot 整理桌面与 VLA

从操作虚拟 GUI 到操作物理世界,难度再上一个量级。以开源项目 XLeRobot(整理桌面任务)为例拆解。

1. 硬件与算法的分工

机器人系统的经典分层:

  • 高层决策(LLM/Agent):任务理解与规划——“把桌面整理干净"拆成"识别物品→分类→抓取→放置”;
  • 中层控制:轨迹规划、运动学解算(机械臂怎么转到目标位姿);
  • 底层控制:电机伺服、力控(STM32/实时总线这一层,毫秒级循环)。

嵌入式同学对底层最熟:瑞芯微 RK3588 这类 SoC 负责视觉推理,STM32 负责实时伺服,中间靠 CAN/以太网通信——AI 再炫,伺服环抖 1ms 都不行,这个分工短期不会变

2. 长程规划与任务分解

"整理桌面"是长程任务(Long-horizon),直接端到端学"图像→关节角度"几乎不可能。工程做法是分层:LLM 把任务分解为子任务序列(先收杯子,再摞书),每个子任务由技能原语(抓取、放置、推)完成。

3. VLA:视觉-语言-动作模型

VLA(Vision-Language-Action)把三者打通:输入图像 + 语言指令,直接输出动作序列(离散动作 token 或连续关节量)。代表如 RT-2、π0 等。

  • 优点:泛化好——没见过的物品也能凭语义理解去抓(“把那个红色的东西拿走”);
  • 局限频率低(大模型推理 5~10Hz,伺服需要 100Hz+,必须配动作分块或扩散策略补频)、精度有限(精细插孔、柔性物体抓取仍不稳)、数据饥渴(真机数据昂贵)。

4. 世界模型与 Sim2Real

  • 世界模型:预测"我做了这个动作后,世界会变成什么样",让机器人在"脑内沙盘"里试错,而不是在真实世界里闯祸;
  • Sim2Real:在仿真环境(Isaac Lab 等)里大规模训练,再迁移到真机。核心难点是仿真与现实的物理差距(摩擦、形变、光照)。常用手段:域随机化(训练时随机扰动物理参数和渲染,逼模型学不变特征)+ 真机微调。

我们的无人零售理货机器人路线图就是:仿真里练"识别货品→抓取→摆正"十万次 → 真机小样本微调 → 门店限定场景灰度。

小结

语音交互的关键词是时序(级联→Omni→全双工,本质是延迟和信息保真度的博弈);Computer Use 的关键词是Grounding 与世界模型(让 Agent 真的"看得到点得准");机器人操作的关键词是分层(LLM 管规划、VLA 管技能、实时控制器管伺服)。三条路线殊途同归:Agent 正在从"会聊天的文本框"变成"有眼睛、有耳朵、有手的数字员工"——而这恰好是无人零售最需要的那种员工。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐