一、定位算法总会给出一个角度,问题是该不该采信

AR-1106 是声源定位(DOA)模组,基于时延估计实现 0~180° 范围的实时方向检测,内置 SG90 舵机驱动可直接带动摄像头云台或机器人转向,通过 9600bps 串口以十六进制输出角度参数(如 90° 输出 0x5A),最远触发距离 5 米,内置 AI 降噪。

把它接入系统后,第一个会遇到的工程问题不是"定位准不准",而是"什么时候该相信这个角度"。原因在于:基于互相关的时延估计对任意宽带瞬态信号都能给出峰值,它并不区分声源是人说话、关门、脚步、椅子拖动,还是键盘敲击。只要有声音,就有输出角度。

如果把每一帧的角度都直接送去驱动舵机,实际表现会是:摄像头频繁乱转,跟着一切声响摆动,反而不如固定不动。这类系统的可用性,主要不是由定位精度决定,而是由什么时候更新、什么时候忽略这套门控逻辑决定。

二、门控层次:从声学到语义

2.1 能量门限

最基础的一层:信号能量低于门限时不做定位。作用是过滤环境本底噪声。缺点是无法区分"响亮的非语音"与"响亮的语音",对关门声完全无效。门限本身还需要随环境噪声自适应,否则安静房间与嘈杂车间需要两套配置。

2.2 语音活动检测(VAD)门控

只在检测到语音时更新角度。语音的判别特征包括:基频(人声通常 80~350Hz)的存在与连续性、谐波结构、共振峰分布、过零率、时长(语音音节通常 100ms 以上,而敲击声是几毫秒到几十毫秒的瞬态)。

其中时长判据对冲击噪声特别有效:要求候选事件在连续多帧内保持一致的角度估计与语音特征,短瞬态自然被排除。代价是引入了对应的响应延迟——一个 200ms 的确认窗口意味着说话人开口后 200ms 才开始转向。对摄像头跟随这类应用,这个延迟完全可接受;对需要即时反应的交互,则要重新权衡。

2.3 估计置信度门控

互相关函数的峰值形态本身携带信息:尖锐、单一、高于旁瓣的峰值意味着估计可靠;平坦、多峰、峰旁比低的情况意味着可能处于强混响或多声源环境,此时角度估计不可信。把峰旁比作为置信度指标,低于阈值时直接丢弃该帧结果,是成本很低但效果显著的一道防线。

2.4 命令词门控

AR-1106 支持定制命令词(单次最多 10 条),且在 5 米远距下仍能稳定触发。用唤醒/命令词作为定位更新的触发条件,是可靠性最高的一层:只有当确认"有人在对设备说话"时才更新方向。这把问题从"检测任何声源"收窄为"检测目标交互事件",误触发率大幅下降。

命令词的设计规则直接影响这层门控的可靠性:建议 4~6 字、4 字最佳;禁止重叠音;避免口语化词汇与多音字;避免叠字与连续零声母词;词条之间若仅差一个字,该字不宜放在末位(末位字受语音截断影响最大,最易混淆)。这些约束的本质都是增大词条之间的声学距离

三、角度平滑:在响应速度与稳定性之间取值

通过门控的角度序列仍然会有抖动,来源包括混响、测量噪声、说话人自身的头部转动。常用的三种平滑手段各有取舍:

  • 一阶低通(指数平滑):实现最简,一个乘加即可。对高斯型抖动有效,但对离群值(一次严重误估)响应缓慢且会被拖偏。
  • 中值滤波:对离群值抑制能力强,是处理"偶发单帧误判"的合适工具。窗口长度需为奇数,典型取 5~9 帧。缺点是对真实的快速转向也会产生延迟。
  • 状态机 + 死区:设定一个角度死区(例如 ±10°),新角度落在当前指向的死区内则不动作。这直接消除了"说话人轻微移动导致云台持续微调"的问题,对机械系统的寿命也有好处。

实践中常见的组合是:中值滤波去离群 → 死区判决决定是否动作 → 一阶平滑生成舵机目标轨迹。

四、机械侧的约束会反过来限制算法

SG90 是典型的模拟舵机,其特性对系统设计有几点硬约束:

  • 启动电流约 800mA。若与 AR-1106 共用同一路 5V 供电,舵机启动瞬间的电压跌落可能导致模组复位。建议为舵机配置独立的 1A~2A 5V 电源,或至少做电源分离与足够的大容量去耦。这是该方案中最常见的现场故障。
  • 存在机械回差与死区。目标角度与实际到位角度之间有误差,且正反方向不对称。若控制环路不考虑这一点,会出现小幅度指令下"指了但没动"的现象。
  • 转动本身产生噪声。舵机运转的机械噪声会被麦克风拾取,形成"转动→噪声→触发定位→再转动"的正反馈。对策是在舵机运动期间暂停角度更新,运动结束后延迟若干毫秒再恢复。

因此角度更新速率不应高于机械系统的响应能力。给出高于舵机跟踪带宽的指令序列,只会造成指令堆积与抖动。合理做法是在算法侧做速率限制,把角度变化率约束在舵机可执行范围内。

五、双麦方案的固有边界

AR-1106 的定位范围是 0~180°,即半平面。这不是产品裁剪,而是两只麦克风的物理限制:仅凭一对麦克风的时延差,无法区分位于其连线两侧对称位置的两个声源(前后模糊)。要获得 360° 无模糊定位,至少需要三只非共线布置的麦克风。

另一个边界是距离。声源定位的有效距离与信噪比、混响时间直接相关。5 米在一般室内环境是合理的,但在混响时间较长的空间(大厅、走廊、玻璃幕墙房间)中,反射声的能量可能接近直达声,互相关峰值被反射路径主导,角度估计偏向墙面而非说话人。此时唯一有效的手段是缩短工作距离或改善房间吸声,算法层面能做的有限。

六、适用判断

AR-1106 适合语音跟随摄像头、语音机器人、互动玩具、设备异响定位、工业声源监测等场景,其价值在于把"方向"这一维信息以极低的系统成本(一路串口 + 一个舵机接口)提供出来。

对精度要求达到几度量级、或需要在强混响/多声源环境下工作、或需要 360° 覆盖的应用,双麦 DOA 方案不适用,应考虑更多阵元的麦克风阵列。选型时先明确三个数字:需要多大角度覆盖、可接受多大角度误差、目标环境的混响时间。这三个数字确定后,方案边界基本就确定了。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐