来源:互联网2026-09-17 08:08:49 热度:

谷歌发布 Gemini 3.8 Live:语音榜登顶,银行任务却只剩三成半?

AI中国网 https://www.cnaiplus.com

导读:用语音助手最尴尬的一刻,不是它答错了,是它闭嘴的时候。你问一句稍微复杂点的话,屏幕转圈,几秒钟没人出声。你会忍不住看一眼手机,怀疑是不是断线了,然后补一句"喂,还在吗"。这十年里,语音产品的体验瓶颈一直卡在这几秒空白上。谷歌今天凌晨发的两条模型,就是冲这几秒来的。一、这次发的到底是什么北京时间 9 月 16 日凌晨,谷歌 DeepMind 发布 Gemini 3.8 Live 和 ......

用语音助手最尴尬的一刻,不是它答错了,是它闭嘴的时候。

你问一句稍微复杂点的话,屏幕转圈,几秒钟没人出声。你会忍不住看一眼手机,怀疑是不是断线了,然后补一句"喂,还在吗"。

这十年里,语音产品的体验瓶颈一直卡在这几秒空白上。谷歌今天凌晨发的两条模型,就是冲这几秒来的。

一、这次发的到底是什么北京时间 9 月 16 日凌晨,谷歌 DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。

两个型号不是同一款的高低配,是按负载性质分的工。Live 管规模和成本,适合大批量、对话式的场景;Extended Thinking 管复杂任务,负责多步骤推理。

都是原生的语音到语音模型,不是"语音转文字、大模型处理、再文字转语音"那种串起来的流水线。

这个区别对开发者来说不小。串行管线每一环都会攒延迟,环数越多,对话越不像对话。

该图片使用了AI生成技术

谷歌发布 Gemini 3.8 Live:语音榜登顶,银行任务却只剩三成半?

二、真正的变化藏在三个机制里这场发布的核心就一句话:模型可以一边推理,一边说话。

Extended Thinking 会用"让我查一下……"这类口头提示先把话接住,再一边跑后台任务,一边把进度讲给你听。工具调用和 API 请求都在后台执行,对话不中断。

配合它的是另外两个机制。

一个是近实时的视觉输入,摄像头或屏幕正在显示什么,它都能接进来。演示里有让它看着棋盘下棋的,也有靠语音反馈把白板草图变成能跑的 React 组件。

另一个是 97 种语言在对话中途自动切换,不用重开一轮会话,也不用给每种语言单独配一个模型。跨国客服最头疼的集成问题,这一条省掉不少活。

还有个容易被忽略的细节:确认码、工单号、金额这类字母加数字的串,它专门做了精度优化。这恰好是语音系统最常翻车的地方。

该图片使用了AI生成技术

谷歌发布 Gemini 3.8 Live:语音榜登顶,银行任务却只剩三成半?

三、成绩单要横着看Extended Thinking 在 Artificial Analysis 的语音到语音质量指数上拿了 82.6 分,登顶总榜。代理任务完成率 τ-Voice 是 68.6%,音频推理基准 Big Bench Audio 97.7%。

但我看这份成绩单,最该盯的是两个数字之间的距离:68.6% 和 35.1%。

前者是通用的语音代理任务,后者是 Sierra 做的银行专用版本 τ-Voice-banking。同一个模型,通用场景能做完近七成,换到银行场景只剩三成半。

这个落差才是真实世界的写照。大多数企业想把语音代理交出去的活,恰恰是查账户、改预约这类高度流程化的操作,而这类任务的公开成绩是三成半。

97.7% 的音频推理得分说明,模型不笨。剩下的问题在于,它能不能把一套多步流程一走到底、中途不跑偏。

把榜首的 82.6 分读成"全面领先"并不准确。那是一个复合指数,而谷歌在公告里既没给单价数字,也没给延迟数字。

该图片使用了AI生成技术

谷歌发布 Gemini 3.8 Live:语音榜登顶,银行任务却只剩三成半?

四、价格和生态才是决定谁能用上的东西定价给得很直接:音频输入每分钟 0.005 美元,音频输出每分钟 0.018 美元,对应每百万输入 token 3 美元、每百万输出 token 12 美元。

这个价格瞄准的是呼叫中心那类场景。一个每月要接几百万通电话的部署,每通会话的成本差一点点,乘起来就是生死线。

上线渠道分了三层。开发者走 Gemini Live API 和 AI Studio;企业先进 Gemini Enterprise 私测;普通用户走 Search Live、Gemini 应用,以及 Docs、GmailKeep 里的 Live 功能。Google AI Pro 和 Ultra 订阅用户能直接用上 Extended Thinking。

基础设施那层交给了 Agora、LiveKit、Pipecat、LangChain、Vercel 这些做实时音视频管线的玩家。企业侧的首批伙伴是 Salesforce、Genspark 和 Lumeris,反馈集中在延迟、对话流畅度和工具调用可靠性上。

两件事我得说清楚。这两款是托管模型,不开源权重,没有自己部署的选项;所有生成的音频都嵌了 SynthID 水印。

五、说到底语音交互做了十年,我越来越觉得卡点不在识别准不准,而在敢不敢当着你的面"思考"。

以前的解法是把思考藏起来,先给你一句"正在处理",再沉默几秒。谷歌这次换了个思路:不藏了,边想边讲,用旁白把等待填满。

这看上去只是体验细节,实际改的是产品形态。当等待不再尴尬,语音才可能从"查询工具"变成"可以一直挂着的助手"。

至于银行那 35.1%,它提醒的是另一件事。能把话说得漂亮,和能把事办完,是两种能力。语音这条赛道的下一程,比的不是谁的声音更像人,而是谁能把那三成半提上去。

AI中国网 https://www.cnaiplus.com

本文网址:

欢迎关注微信公众号:人工智能报;合作及投稿请联系:editor@cnaiplus.com

AI中国号...

关注微信公众号,了解最新精彩内容