谷歌发布新语音模型,边想边说还能办事

2026-09-16 14:34:23 0点赞 0收藏 0评论

谷歌今天发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,官方称这是它们「目前最先进的实时对话模型」。

上一代是今年三月发的 3.1 Flash Live,这次的目标是让跟 AI 对话这件事更接近自然交谈。

谷歌发布新语音模型,边想边说还能办事

Gemini 3.8 Live Extended Thinking 主打更高的智能和多步推理能力,面向的是高复杂度任务,比如刚推出不久的 Gmail Live 对话式搜索、Docs Live 草稿生成与编辑、Keep Live 笔记创建。这个模型今天也开始在 Gemini Live 里铺开。

它有个特点叫「边推理边说话」。在保持对话不中断的前提下提升复杂工作流的智能水平,做法是用「让我查一下」这种早期的口头提示自然回应用户,再用实时进度播报带着用户走完多步后台任务。

跑分方面给了一串数字。Artificial Analysis 的语音对话质量指数它拿到 82.6 分,排第一。τ-Voice 的智能体任务完成度是 68.6%,Sierra 的 τ-Voice 银行场景基准 35.1%,Big Bench Audio 拿到 97.7%。价格方面官方称跟其他前沿模型相比有竞争力。

Gemini 3.8 Live 基础版走的是另一条路,主打流畅对话和视觉理解。它能近乎实时地处理视觉输入,工具和 API 调用在后台执行的同时对话继续。用户可以期待的是模型先确认请求、继续聊天,任务在后台完成。它还能在对话中途识别并切换 97 种支持的语言。官方说这个版本是为规模和成本效率设计的,在 Speech Agent Arena 上排第二。

Gemini 3.8 Live 将驱动 AI 模式里的 Search Live 体验。

语音助手这次卷的是什么

把两代产品的定位摆在一起看,方向变化挺清楚。

过去语音助手的竞争点是听懂和答对,语音识别准不准、语义理解对不对。这次的竞争点换成了「对话不中断」。3.8 Live Extended Thinking 那个「边推理边说话」的设计,冲着长任务里最难受的一段体验去。模型思考的时候界面上什么都没有,用户不知道它在干活还是卡住了,只能干等。加一句「让我查一下」,再加实时进度播报,等待的时间就从空白变成了有反馈的过程。

这跟去年一堆产品把思考过程显式展示出来是同一个思路,只是语音场景比屏幕场景更难做,因为你没法在音频流里塞一屏文字,只能靠口语化的提示音和短句。

另一条线是多步任务的执行能力。τ-Voice 这个基准测的是智能体能不能把一件事从头做到尾,银行场景的分支更是直接对着真实业务流程。这类场景对语音助手来说是新战场,过去的助手止步于回答,现在要真的动你的账户和日历。

对国内用户的直接影响有限。Gmail Live、Docs Live、Keep Live 这些配套功能都不在国内提供,Gemini 本身也没进来。但这个方向值得留意,苹果的新 Siri 走的是屏幕感知加跨应用执行,华为小艺和 vivo 蓝心走的是跨端调度,大家都在往同一个地方去,重点从「能听懂」变成「能办事」。

你觉得语音助手最该先补上哪一块,是听懂人话还是把事办成?

作者提示含AI生成内容。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松