AI中国网 https://www.cnaiplus.com
用语音助手最尴尬的一刻,不是它答错了,是它闭嘴的时候。
你问一句稍微复杂点的话,屏幕转圈,几秒钟没人出声。你会忍不住看一眼手机,怀疑是不是断线了,然后补一句"喂,还在吗"。
这十年里,语音产品的体验瓶颈一直卡在这几秒空白上。谷歌今天凌晨发的两条模型,就是冲这几秒来的。
一、这次发的到底是什么北京时间 9 月 16 日凌晨,谷歌 DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
两个型号不是同一款的高低配,是按负载性质分的工。Live 管规模和成本,适合大批量、对话式的场景;Extended Thinking 管复杂任务,负责多步骤推理。
都是原生的语音到语音模型,不是"语音转文字、大模型处理、再文字转语音"那种串起来的流水线。
这个区别对开发者来说不小。串行管线每一环都会攒延迟,环数越多,对话越不像对话。
该图片使用了AI生成技术
二、真正的变化藏在三个机制里这场发布的核心就一句话:模型可以一边推理,一边说话。
Extended Thinking 会用"让我查一下……"这类口头提示先把话接住,再一边跑后台任务,一边把进度讲给你听。工具调用和 API 请求都在后台执行,对话不中断。
配合它的是另外两个机制。
一个是近实时的视觉输入,摄像头或屏幕正在显示什么,它都能接进来。演示里有让它看着棋盘下棋的,也有靠语音反馈把白板草图变成能跑的 React 组件。
另一个是 97 种语言在对话中途自动切换,不用重开一轮会话,也不用给每种语言单独配一个模型。跨国客服最头疼的集成问题,这一条省掉不少活。
还有个容易被忽略的细节:确认码、工单号、金额这类字母加数字的串,它专门做了精度优化。这恰好是语音系统最常翻车的地方。
该图片使用了AI生成技术
三、成绩单要横着看Extended Thinking 在 Artificial Analysis 的语音到语音质量指数上拿了 82.6 分,登顶总榜。代理任务完成率 τ-Voice 是 68.6%,音频推理基准 Big Bench Audio 97.7%。
但我看这份成绩单,最该盯的是两个数字之间的距离:68.6% 和 35.1%。
前者是通用的语音代理任务,后者是 Sierra 做的银行专用版本 τ-Voice-banking。同一个模型,通用场景能做完近七成,换到银行场景只剩三成半。
这个落差才是真实世界的写照。大多数企业想把语音代理交出去的活,恰恰是查账户、改预约这类高度流程化的操作,而这类任务的公开成绩是三成半。
97.7% 的音频推理得分说明,模型不笨。剩下的问题在于,它能不能把一套多步流程一走到底、中途不跑偏。
把榜首的 82.6 分读成"全面领先"并不准确。那是一个复合指数,而谷歌在公告里既没给单价数字,也没给延迟数字。
该图片使用了AI生成技术
四、价格和生态才是决定谁能用上的东西定价给得很直接:音频输入每分钟 0.005 美元,音频输出每分钟 0.018 美元,对应每百万输入 token 3 美元、每百万输出 token 12 美元。
这个价格瞄准的是呼叫中心那类场景。一个每月要接几百万通电话的部署,每通会话的成本差一点点,乘起来就是生死线。
上线渠道分了三层。开发者走 Gemini Live API 和 AI Studio;企业先进 Gemini Enterprise 私测;普通用户走 Search Live、Gemini 应用,以及 Docs、GmailKeep 里的 Live 功能。Google AI Pro 和 Ultra 订阅用户能直接用上 Extended Thinking。
基础设施那层交给了 Agora、LiveKit、Pipecat、LangChain、Vercel 这些做实时音视频管线的玩家。企业侧的首批伙伴是 Salesforce、Genspark 和 Lumeris,反馈集中在延迟、对话流畅度和工具调用可靠性上。
两件事我得说清楚。这两款是托管模型,不开源权重,没有自己部署的选项;所有生成的音频都嵌了 SynthID 水印。
五、说到底语音交互做了十年,我越来越觉得卡点不在识别准不准,而在敢不敢当着你的面"思考"。
以前的解法是把思考藏起来,先给你一句"正在处理",再沉默几秒。谷歌这次换了个思路:不藏了,边想边讲,用旁白把等待填满。
这看上去只是体验细节,实际改的是产品形态。当等待不再尴尬,语音才可能从"查询工具"变成"可以一直挂着的助手"。
至于银行那 35.1%,它提醒的是另一件事。能把话说得漂亮,和能把事办完,是两种能力。语音这条赛道的下一程,比的不是谁的声音更像人,而是谁能把那三成半提上去。
AI中国网 https://www.cnaiplus.com
本文网址:




