做智能音箱、会议摄像头、巡检机器人的工程师,多多少少都动过"让设备循声转头"的念头。但一查方案——4麦、6麦、甚至7麦阵列,再加上一套波束成形算法和调不完的参数,很多人就默默把这个需求从 PRD 里删掉了。

今天介绍一个画风不太一样的模组:AR1105。3 颗数字麦克风 + 6 个 IO 输出,直接告诉你声音在哪个方向——不写一行代码,不用任何 SDK


一、先说结论:这玩意儿到底怎么"说话"

传统的声源定位(SSL, Sound Source Localization)方案,输出的一般是一个角度数据,需要你通过 I2C/SPI/UART 去读寄存器、解析协议,甚至跑一遍厂家给的算法库。

AR1105 的输出方式粗暴到让人感动:

  • 模组外围有 6 个方向 IO 端口,分别对应 0° / 60° / 120° / 180° / 240° / 300° 六个方向;
  • 模组进入工作状态后持续刷新音源角度,当前声源所在方向的 IO 输出高电平(3.3V),其余为低;
  • 你的主控 MCU 只需要做一件事:读 IO 电平

对,就这么简单。判断声源方向这个动作,在嵌入式里退化成了 if (HAL_GPIO_ReadPin(...)) 级别的操作——甚至用几个三极管加逻辑门都能玩出花来。

    120°        60°
     180°  ┌──────┐  0°
           │ AR1105 │
     240°  └──────┘  300°
        (哪个IO是高电平,声音就在哪边)

二、原理:3 麦克风凭什么够用?

一般来说,麦克风数量越多,角度分辨率越高(6 麦可以做 15° 甚至更细的分区),但代价是阵列尺寸、成本和算力。

AR1105 的思路是降维打击:很多应用场景根本不需要 1° 级的精度——智能小车循声转向、摇头摄像头寻声拍摄,6 个方向(每 60° 一个扇区)完全够用。

具体做法:

  • 3 颗数字麦克风等边三角形排列,间距固定 10mm
  • 利用每 2 颗麦克风组合出的心形指向性,两两组合共 3 组指向特性;
  • DSP 内核实时比对三组指向性的能量分布,解算出声源落在哪个 60° 扇区;
  • 解算结果直接映射到 6 个方向 IO 上输出。

牺牲了角度分辨率,换来的是:

对比项

常规 4-6 麦阵列方案

AR1105

麦克风数量

4~6+

3

阵列尺寸

大(几十~上百mm)

等边三角形,边长10mm

软件开发

算法库/SDK/调参

无需代码

输出接口

数据协议解析

6 个高低电平 IO

后级要求

MCU 跑算法

任意 MCU 甚至纯硬件逻辑

注意:规格书明确说明,麦克风的间距 10mm 和等边三角形排布是推荐最佳状态,自己拉长、缩小、甚至减麦数量,定位准确性就无法保证了。

三、硬件规格速览

项目

参数

供电

DC +4V ~ +6.5V

工作电流

28~31mA

逻辑电平

3.3V(方向 IO 高电平有效)

定位方向

圆周 6 方向,间隔 60°

拾音范围

10cm ~ 200cm

音频输出

模拟(MIC_OUT,10kΩ,最大 1Vrms)+ I2S 数字(16kHz / 16bit,主模式)

麦克风接口

3 路数字麦(CLK/DAT),MIC0 端口可复接 2 个

工作温度

-20℃ ~ +85℃

模组尺寸

37mm × 26mm

这里有个很实用的设计:模组不止会"指方向",还预留了音频输出。

3 麦阵列捕获的声音可以同时从两路输出:

  • 12 脚 MIC_OUT:模拟音频输出,直接接后级功放/音频 ADC;
  • 15/16/17 脚 I2S:16kHz、16bit、标准 I2S 格式数字音频,接带 I2S 输入的 SoC 或 codec。

也就是说,你可以做一台"循声转头 + 采集录音"的设备,比如寻声摄像头:转动的同时把音频录下来。模拟和数字输出是同时有效的,按需选用。

⚠️ 但要注意:这路音频是"裸"的。模组对输出音频不做降噪、不做 AEC 消回音、不做波束拾音。如果你的设备要做语音识别(尤其是远场唤醒),后端需要自己规划音频处理链路。它是个"方向指示器 + 麦克风前级",不是完整的语音前端。

四、引脚定义(关键脚位)

模组共 24 脚,半孔焊盘 + 排针插孔两种焊接方式(已成型产品用转接板快速接入,新产品可直接按尺寸图做成焊盘贴装)。

引脚

名称

功能

1

+5V

电源输入(+4V~+6.5V)

2

GND

电源地

3~8

0°~300°

六个方向输出 IO(高电平有效,角度起点可自定义)

9

IO1

预留 IO,默认电源指示:上电高、启动完成后变低

12

MIC_OUT

处理后模拟音频输出

15/16

LRCK / BCLK

I2S 时钟(16kHz/16bit)

17

MIC_DOUT

I2S 数字音频输出

13/14

L/R_LINE IN

备用音频线路输入

19

+3V3

数字麦克风供电输出

21~24

CLK01 / DAT01

数字麦克风接口

一个容易被忽略的细节:方向的角度值是可以自定义的。因为声源是在阵列四周转动的,任何一个方向都可以定义为 0° 起点,只要保持 60° 等分即可——这意味着安装时不用纠结模组在设备里的朝向,软件上对齐一下就行。

另外一个细节:IO1 引脚自带启动状态指示——上电时为高电平,启动完成后转为低电平。主控 MCU 可以监测这个脚,判断模组是否就绪,避免上电初期读到无效的角度数据。

五、麦克风怎么选?

模组本身是 DSP 核心板,麦克风需要外接,选型有讲究:

  1. 三颗必须同型号、批次接近、一致性好——规格书要求灵敏度误差控制在 ±1dBFS 以内,否则麦克风之间的拾音差异会直接污染定位结果;
  1. 推荐灵敏度 -26dBFS(约等效电容麦 -42dB)或 -29dBFS(约等效 -44dB);
  1. 强烈建议选进声孔在底部的封装,PCB 表面开孔安装,让三颗麦克风振膜处于同一平面,减少拾音不平衡;
  1. 官方配套的 3DMIC-291 阵列板用的就是 -29dBFS 规格,拾音距离 10-200cm;要更远的拾音距离,可以换更高灵敏度的数字麦型号。

六、怎么验证?官方给了个"玩具级"测试底板

AR1105 单板没法独立工作,官方配了一套测试组件:

  • 3DMIC-291:三数字麦克风阵列板(等边三角形布局);
  • AR-6LED:圆形测试底板,板载方向指示 LED 和 TYPE-C 供电口。

装配流程:3DMIC-291 通过排针排母插到 AR-6LED 顶部,AR1105 焊接或插接到 AR-6LED 背部,然后插上 USB 线:

  1. 上电后中间红色 LED 亮起,启动约 7~9 秒
  1. 启动完成转蓝色 LED,圆形底板周边会点亮某一个方向的 LED;
  1. 在底板四周不同位置说话或播放音乐,方向 LED 会实时跟着声音位置切换

五分钟内就能直观看到"声源追踪"的效果,做演示给老板/客户看也非常直观。AR-6LED 上还预留了多种 IO 和音频端口,可以直接和外部设备通讯、传音频,原型验证和成品开发都能用。

七、适合谁用?

按规格书的应用方向结合实际开发体验,我认为它特别适合这几类场景:

  • 循声转向的小型设备:音源寻位智能小车、循声摇头的玩具机器人——60° 分辨率足够转向决策;
  • 安防类:智能摇头摄像头寻声拍摄、声源追踪预警设备,声音触发 + 方向引导;
  • 会议设备:多人视频会议中跟踪说话人方向,驱动云台或指示灯;
  • 人声采集录音设备:定位 + 音频输出一条龙。

反过来,这些场景要慎重:

  • ❌ 需要 1° 级角度精度(如专业声学测量、精密波束控制);
  • ❌ 依赖模组输出音频直接做远场语音识别且对信噪比要求高(音频未做降噪/AEC);
  • ❌ 拾音距离超过 2m 的场景(除非换更高灵敏度麦克风并实测验证)。

八、总结

AR1105 的产品逻辑很清晰:把"声源定位"从一个算法问题,变成了一个硬件 IO 问题。

它不追求极致的角度分辨率,也不提供复杂的音频处理,而是用 3 颗麦克风 + 心形指向性组合这种"够用就好"的工程取舍,换来三个非常有价值的特性:极小的阵列尺寸(10mm 等边三角形)、极低的集成门槛(读 IO 电平)、零软件开发成本(无需 SDK)

对于"设备循声转头"这类需求,它是那种可以一个下午就集成进原理图、一晚上就点亮 demo 的方案。在越来越卷的智能硬件市场,能大幅缩短"想法→原型"路径的模块,永远有它的位置。


本文基于《AR1105 声源定位模组规格书》整理,具体硬件设计请以最新官方资料为准。详细咨询请私信公众号后台,期待与您交流。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐