当机器人开始全面认真倾听:音频具身智能综述来了

论文题目:Audio Embodied Intelligence: Auditory Perception, Reasoning, and Interaction for Multimodal Agents
论文作者:Wentao Lei, Tianxin Xie, Kai Jiang, Li Liu | HKUST(GZ)
项目主页:https://audio-emb.netlify.app/
论文链接:https://audio-emb.netlify.app/paper.pdf
这篇综述把分散在机器人听觉、音视频导航、语音指令、VLA 策略和社会机器人中的音频研究放到同一框架中:声音如何进入具身智能体的感知、推理、行动与互动闭环。
⏩开场:只会“看”的机器人,错过了什么?
如果一个机器人只能看见,它会错过很多关键线索:门外传来的呼救声、杯子落地的瞬间、机械臂接触失败时的摩擦声、用户话语里的犹豫和急迫。
声音不是视觉的附属通道。对具身智能体来说,音频常常是世界给出的另一种证据:它可以来自视野之外,可以在接触发生的瞬间出现,也可以携带任务意图、情绪状态和社会反馈。
这正是这篇综述想回答的问题:当声音进入具身智能系统,它究竟改变了智能体的什么?

图 1 论文定义的 embodied audio:声音可以作为物理证据、语义/副语言证据,也可以作为影响行动和社交反馈的交互信号。
⏩这篇综述解决了什么问题?
过去几年,具身 AI、机器人学习、视觉-语言-动作模型发展很快,但音频相关研究仍分散在多个社区: robot audition、audio-visual navigation、spoken instruction following、contact-audio manipulation、social HRI 等等。它们都在使用声音,却往往讨论的是不同问题。
论文指出,关键不只是“模型有没有音频输入”,而是声音是否对一个智能体的感知、推理、行动、互动或评估产生了明确贡献。换句话说,声音有没有改变智能体感知什么、思考什么、说什么、做什么。
|
论文的核心视角 把音频从孤立的识别任务中拿出来,放回具身闭环里看:what is sensed, what is inferred, and how the inference changes action or interaction. |
⏩一个统一框架:三条 loop,三个 stage
论文提出 two-axis loop-stage taxonomy。第一条轴是 loop axis,关注声音贡献的是哪类状态;第二条轴是 stage axis,关注声音在闭环中处于感知、推理还是交互阶段。

图 2 论文提出的统一框架:三类 auditory embodied loops 跨越 Percept、Reason、Interact 三个阶段。
Loop axis:声音进入哪一种具身闭环?
-
Physical Interaction Loop:声音作为物理证据,帮助智能体理解空间、物体、材料、接触和动作后果。
-
Semantic Grounding-and-Action Loop:语音、声音和语言承载任务含义,需要被绑定到物体、位置、动作和约束。
-
Socio-Affective Interaction Loop:语音声学和副语言线索提供用户状态、情绪、关系、社会规范等信息。
Stage axis:声音在闭环里做什么?
-
Percept:从 situated observations 中提取可靠的 auditory 或 multimodal cues。
-
Reason:把 cues 转换成任务相关的物理状态、语义状态、用户模型或社会解释。
-
Interact:利用推理出的状态生成物理行动、语音回复、表达行为、反馈或恢复策略。
⏩九个分类:从听见,到理解,再到行动
三条 loop 与三个 stage 交叉后,形成九个 loop-stage categories。它们给不同研究社区提供了一个共同坐标系,以及每个部分的一些主要的研究方向。
-
P1 Physical Acoustic Sensing:声源定位与跟踪、声事件检测、麦克风阵列、主动听觉、分离与增强。
-
P2 Audio-Physical Understanding:音视频导航、声学仿真、声学地图、场景理解、物理属性估计。
-
P3 Audio-Physical Interaction:音频引导操作、失败检测、空间音频生成、声音反馈界面。
-
Se1 Speech and Audio Understanding:ASR、口语指令解析、音频描述、多轮对话理解。
-
Se2 Grounded Multimodal Reasoning:长期记忆、音频-语言 grounding、音视频问答、audio-conditioned VLA reasoning。
-
Se3 Spoken Interaction:全双工语音交互、安全拒绝与解释、在线指令纠正、行动解释语言生成。
-
So1 Affective Perception:语音情绪识别、说话人识别、副语言分析、多模态情感识别。
-
So2 User and Social State:社会文化感知推理、个性化用户建模、关系建模、用户状态估计、隐私与安全建模。
-
So3 Expressive Output:表达性语音与时机、伴随手势、非语言机器人声音、sonified feedback。
⏩为什么它重要?评价不能只看识别准确率
论文强调,auditory embodied intelligence 的评估不应停留在识别、定位或转写是否准确,而应追问:声音是否真的改善了闭环行为?
例如,一个 audio-aware navigation policy 应该与 audio-off、vision-off、corrupted-audio、delayed-audio、oracle-audio 等版本比较;一个接触音频操作策略应展示声音是否降低失败延迟、提高恢复率;一个社会机器人则应测试 vocal affect 是否改善响应选择,同时不牺牲用户舒适度和隐私。
⏩落地场景:工业、教育、服务机器人
论文按部署场景梳理了 auditory embodied intelligence 的应用价值。
-
工业机器人:听见异常振动、碰撞、漏气、工具颤振、接触失败,把声音转化为检测、恢复和安全动作。
-
教育机器人:听见提问、停顿、犹豫、轮流发言和参与度变化,让教学助手更会提问、更会等待、更会反馈。
-
服务与陪伴机器人:听见家庭安全事件、用户请求、distress cues 和社交语境,让家庭、医疗、养老和公共服务更自然、更透明。
⏩未来挑战:让机器人真正听懂世界
综述最后指出,音频具身智能仍面临一系列系统级挑战:
-
数据集:从离线音频片段走向 embodied episodes,记录机器人位姿、动作历史、任务状态、人类反馈和音频 ablation。
-
感知鲁棒性:处理 ego-noise、远场语音、混响、多说话人、移动麦克风、设备差异和隐私限制。
-
推理能力:建立 causal acoustic world models、音频-语言空间记忆、事件不确定性和长期用户状态建模。
-
交互控制:决定何时行动、何时询问、何时拒绝、何时解释,并把声音反馈做得有用而不打扰。
-
部署风险:面对仿真到真实的声学差距、语音注入、隐私泄露、文化差异和长期用户舒适度。
⏩结 语
从听见一个声源,到理解一次接触;从解析一句指令,到感知用户的犹豫;从发出一个反馈音,到改变一次交互策略,声音正在成为具身智能中越来越关键的因素。
这篇综述的价值,在于它没有把音频视作孤立模块,而是追问声音如何进入物理、语义和社会三类闭环,并最终改变智能体的行为。对于正在走向真实世界的多模态智能体来说,这也许正是下一步必须补上的能力:不仅会看、会说、会动,也要真正会听。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)