凌晨的发布会刚散场,科技圈就被一个消息刷屏了:谷歌一口气甩出两款专为语音交互打造的全新人工智能模型——Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。如果说过去的语音助手还停留在"听得懂"的阶段那么这一次,谷歌直接把它推进到了"会思考、能干活"的全新次元。近乎瞬时的逻辑推理、边说边看的视觉理解、还有后台默默调API的执行能力,这套组合拳打下来,语音AI的商业化时代真的要来了。

Google Unveils Gemini Live Voice Assistant to Rival ChatGPT Voice Mode

从"流畅聊天"到"深度思考",两条腿走路

这次发布的两款模型,定位其实分得相当清楚,一个主打规模与成本,一个专攻复杂推理

Gemini 3.8 Live 是面向大规模部署的主力选手。谷歌在成本控制和对话体验之间找到了一个相当漂亮的平衡点。最让人惊艳的莫过于它的多语言能力——模型可以自主检测并毫无顿挫地在97种支持语言之间切换,哪怕你上一句说中文、下一句蹦英文,它都能自然接住。更值得一提的是它首次引入的"视觉上下文"能力你一边语音提问,一边把摄像头画面同步传给它,它就能结合眼前看到的场景,给出精准到细节的回答。

Google Gemini Live's AI voice now comes in ten more styles that take  inspiration from the stars | TechRadar

而 Gemini 3.8 Live Extended Thinking 则是为硬核任务而生的版本。遇到需要深度拆解的多步骤问题时,它会悄悄在后台发起API调用,同时用拟真自然的语音跟你"汇报进度",就像一位真正专业的助理在边说边处理工作,对话节奏完全不会被打断。根据官方公布的AI语音质量指数(AISQI)成绩,这个版本以82.6分冲上榜首,这个分数在目前的语音模型圈子里可以说是断层领先

开发者狂喜的定价,生态加速落地

为了降低企业接入的门槛,谷歌直接宣布两款模型即刻通过 Gemini API 和 Google AI Studio 向开发者开放。价格更是卷出了新高度:音频输入每分钟只要0.005美元,音频输出每分钟0.018美元这个定价意味着,中小团队甚至个人开发者,也能低成本搭建起以前只有大厂玩得起的实时语音应用。

开发者与企业,是时候用Gemini Pro 打造你的应用了[译] | 宝玉的分享

配套的工具链也没有落下。谷歌把自研的 Gemini 3.5 Transcribe 语音转文本模型塞进了完整的音频开发套件,流畅支持超过85种语言,流式词错误率低至4.0%,还支持自定义词汇偏好和智能转录模式。与此同时,LiveKit、LangChainVercel 这些主流流媒体基础设施平台已经全部完成深度整合,实时语音应用的部署难度被大幅拉低。

安全与场景落地,两手都要硬

在AI音频泛滥的当下,谷歌给所有生成的音频都嵌入了 SynthID 数字水印。这种水印人耳完全无法察觉,却能让AI生成内容全程可追溯,为防范虚假信息加了一道保险

落地层面,Gemini 3.8 Live 已经率先进驻 Google Search Live,更高级的扩展思考版本也将逐步向 Gemini Live 用户开放,Google AI Pro 和 Ultra 的企业订阅用户同样可以体验到这套语音生产力工具。

AI 语音】实时语音交互优化全解析:从RTC 技术到双讲处理-腾讯云开发者社区-腾讯云

为什么说这是语音AI的"商业化元年"?

回望过去,语音助手一直被一种级联架构拖累:先语音转文字,再交给大模型处理,最后文字转语音。三层接力带来的不仅是居高不下的响应延迟,更致命的是它根本无法应对对话中的打断、插话和情绪变化体验始终带着一层"机器感"。

Gemini 3.8 Live 系列的横空出世,意味着原生语音技术真正跨过了商业化的临界点。尤其是异步函数调用机制的出现,让语音AI不再是一本"会说话的百科全书",而是进化成了一位能边聊边操作后台软件调度API的虚拟助手。技术形态的转变,往往就是市场洗牌的前奏。

谷歌深度思维Gemini 模型推动人工智能语音技术发展

可以预见,凭借这套极具攻击性的API定价和原生语音架构,客户服务系统、实时翻译服务、企业知识检索这些传统场景都将被重新审视,而依赖文本驱动的老式语音机器人,或许真的要开始倒计时了。对于开发者和企业来说现在入场,正当时。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐