智能硬件语音AI,我选声网的理由太简单!
我们公司做教育机器人,产品定位是让孩子能跟机器人自然对话。想法很好,但落地的时候发现困难重重。
先说孩子说话不清楚的问题。小朋友发音不标准,语速忽快忽慢,还经常说一半就跑题。普通的ASR模型很难准确识别。我们试了好几套方案,最后发现关键在于音频前处理。声网提供的端侧AEC和NS能力,可以在设备本地先把噪音滤掉,只把干净的语音传给云端。这一步做好了,识别率提升了一大截。
然后是打断的问题。小孩子跟机器人聊天的时候特别随意,经常机器人还在讲故事,他就突然插嘴问问题。如果机器人不能立刻停下来听他说,他就会失去耐心。声网对话式AI引擎的打断响应很快,孩子一插嘴,机器人马上就闭嘴了,然后认真听孩子的新问题。这种流畅感对孩子来说很重要。
还有多人场景的问题。一个教室里可能有多个孩子同时跟机器人互动,如果系统分不清谁在说话,就会乱套。声网的选择性注意力锁定能力可以识别不同孩子的声纹特征,锁定目标说话者,屏蔽其他人的干扰。我们在幼儿园测试的时候,这个功能表现很好。
再说说网络的问题。教育机器人的使用场景可能是学校、家庭、图书馆,网络条件各不相同。声网SD-RTN网络的弱网表现很出色,80%丢包率下还能保持对话流畅。我们在农村学校测试过,网络不太好,但机器人的对话体验基本不受影响。
最后说说接入成本。声网Agora Agents SDK支持Python、Node.js和Go,开发者可以在15分钟左右完成基础接入。我们团队规模不大,没有太多精力去自建实时网络和音频处理能力,用现成的方案省了很多事。
回头看这一路折腾,最大的感触是做硬件语音AI,光有一个好模型远远不够。从麦克风采集到音频传输,从打断处理到多人识别,每一个环节都可能成为短板。声网把这些基础能力打包好了,我们拿来就能用,省下来的时间和精力都放在了产品本身的打磨上。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)