Gemini 3.8 Live一夜登顶语音榜,刷屏的"价格打到OpenAI十分之一"却算错了口径:上车"边说边干"之前,先分清两种模型、三类人群和真正霸榜的中国玩家

源自171位全网作者

01:03

昨晚(美西时间9月15日,北京时间今天凌晨),谷歌甩出两款新模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。到今天白天,第三方评测机构 Artificial Analysis 的语音对语音榜单第一名已经易主——Extended Thinking 版以 82.6 分空降第一,把 OpenAI 的 GPT-Live-1(81.5 分)挤到了第二。知乎

Gemini 3.8 Live一夜登顶语音榜,刷屏的

这个 9 月本来就是"模型流星雨":GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash、DeepSeek V4.1 Flash……13 天里 7 家公司发了 11 个前沿模型。如果你已经追新模型追到腻,这篇只回答一个问题:语音这波,值不值得你花时间跟进、要不要掏钱。微博

先说结论:值得知道,但不必连夜上车。理由往下看。

一、"边说边干"到底改了什么

以前的语音助手,基本都是三段式流水线:你的话转成文字→大模型思考→文字再合成语音。每转一手就丢一层东西,你的语气、犹豫、不耐烦,全在转文字那步被抹平了;模型一旦要查资料、调工具,你只能拿着电话干等,三秒还能忍,十秒后就开始怀疑是断线了还是它没听懂。

Gemini 3.8 Live 这次是原生语音对语音(speech-to-speech),把流水线拆了:

  • 能边听边说:支持随时打断(官方叫 Barge-in),你话说一半它能停下来让你讲;第三方实测首段音频延迟约 1.18 秒,比 GPT-Live-1 的 1.35 秒快了一截——语音这东西,快 0.2 秒,体感就是"像人"和"像机器"的区别。知乎知乎

  • 能看着画面聊:开启摄像头,画面直接进对话上下文。官方演示里用户把镜头对准水管问"这个阀门怎么关",不需要先用语言描述现场。知乎

  • 能后台干活:跟你聊天的同时调用工具去查、去写、去排日程,语音通道不中断。

  • Extended Thinking 版更狠,“边想边说”:复杂问题不再沉默卡顿,它会先说一句"让我查一下"接住节奏,然后边推理边播报进度,官方的说法是 reasons and speaks simultaneously。

另外两个细节:一是它支持大约 97 种语言。二是所有生成音频都嵌入 SynthID 隐形水印,可以检测出"这话是不是 AI 说的"。在 AI 语音诈骗越来越猖狂的当下,从源头打水印比事后鉴定实在,这点值得给谷歌鼓掌。知乎知乎

二、刷屏的"价格打到 OpenAI 十分之一",先别照单全收

今天传播最广的一个数字:Gemini 3.8 Live 音频输入定价每分钟 0.005 美元,而 OpenAI 7 月发布的 GPT-Live-1 是每分钟 0.05 美元——十倍差距,“价格战开打”。知乎

这个数字是真的,但它是"价目表口径"。Artificial Analysis 按"每小时输入音频实际成本"测算(把音频和文本的输入输出、推理 token 全算进去再折算),3.8 Live 是每小时 0.84 美元,ET 是 3.50 美元。集微网援引的第三方测算结论则是"一小时语音对话成本约为 GPT-Live-1 的一半"。十倍和一半,差的就是口径。价格战确实在打,但没打到骨折。知乎微博

更关键的是,这次的两款模型根本不是"普通版和高级版"的关系,而是两种活:

Gemini 3.8 Live

3.8 Live Extended Thinking

官方定位

规模与成本效率

高复杂度任务

实测成本(每小时输入音频)

0.84 美元

3.50 美元(贵 4 倍多)

τ-Voice 客服任务完成率

30.1%

68.6%

Conversational Dynamics(对话自然度)

96.1%(占优)

91.9%

Arena Elo

1083

990

大众端入口

Search Live

Gemini Live、Workspace(Docs/Gmail/Keep)

这张表的坑在哪?便宜档在复杂客服任务上完成率只有 30.1%——十单里七单办不成。而一旦把成本折算到"每办成一单",4 倍的价差会缩到约 1.8 倍。便宜不等于办同样的事花更少的钱,失败和重试都是要付钱的。知乎

Gemini 3.8 Live一夜登顶语音榜,刷屏的

对个人用户还有个更实际的坑:语音是按分钟计费,不是按 token。知乎有博主一句话点破——"每分钟 0.005 美元"里那个"起"字最骗人:真跑长推理加实时视觉,分钟单价会上去,而目前全网还看不到一份完整的长会话账单样例。知乎

三、反常识的一点:语音榜前排,站着的其实是中国模型

谷歌发布的同一天(9 月 15 日),阶跃星辰发布了 StepAudio 3 系列,一口气五款模型(Realtime、ASR、TTS、Gen、Music)。按 Artificial Analysis 榜单:StepAudio 3 Realtime 在对话自然度榜(Conversational Dynamics)以 98.9% 排全球第一——比 Gemini 3.8 Live 的 96.1% 还高;语音识别词错率做到 1.7%,同样全球第一;阿里 Qwen Audio 3.0 RP 也咬在榜单前排。财新、IT之家、艾瑞网都做了报道。微博微博微博

Gemini 3.8 Live一夜登顶语音榜,刷屏的

也就是说:Gemini 3.8 Live Extended Thinking 拿下的是"语音对语音综合指数"第一,但在对话自然度、语音推理、语音识别这些细分赛道,榜首是中国名字。

这对你的钱包很实际:如果你的主要场景就是中文语音对话,豆包的全双工实时语音通话今年 4 月已接入 Seeduplex 全双工语音大模型。通话支持随时打断,还能用四川话、粤语或英语通话。再加上阶跃星辰开放平台,现在零门槛就能用,不需要为追 Gemini 语音专门折腾账号和网络环境。小红书小红书

四、现在想上手?分三种人

  1. 普通用户,想在 Gemini app 里体验"边说边干":先解决渠道——谷歌服务在大陆没有官方入口,需要海外账号和相应网络环境,且语音数据会走境外服务器。消费端入口这次是分叉的:3.8 Live 进 Search Live,Extended Thinking 进 Gemini Live 和 Workspace。已有谷歌 AI 订阅的,可以留意推送节奏;没有订阅的,不建议为它专门开一个。知乎

  2. 开发者,想做语音 Agent:两款模型都已通过 Gemini API 和 AI Studio 开放,可以先用 AI Studio 免费试 Live API,再拿一百条真实任务做双跑——高频轻量对话走 3.8 Live(每小时 0.84 美元),长链路高价值任务走 ET(每小时 3.50 美元)。生态这次给得很齐:实时链路有 LiveKit、Pipecat、Agora,编排有 LangChain,部署有 Vercel。

  3. 国内场景用户(客服、陪伴、车载):先看 StepAudio 3 和 Qwen Audio 的实测,再决定要不要碰 Gemini——榜单上它们领先,数据合规也省事。参考一个行业锚点:Klarna 的 AI 客服上线首月处理 230 万通对话、相当于 700 个人工客服的工作量,但那是文字优先的场景;语音客服要过的关,是 τ-Voice 那个 30.1% / 68.6% 的任务完成率。知乎

Gemini 3.8 Live一夜登顶语音榜,刷屏的

五、先别急着掏钱,盯住三个信号

  • 中文实测:97 种语言听着唬人,但多语言语音模型的通病是"英语惊艳、其他语言露怯"。等有人拿中文实测打断、抢话、方言的处理,再信宣传。知乎

  • 长会话账单:只要还没人晒出 Extended Thinking 跑长对话的真实账单,"每分钟 0.005 美元起"就只能当广告语听。

  • OpenAI 的反击:GPT-Live-1 被挤到第二不会坐视,B站资讯 UP 主已经在传"OpenAI 本周有重磅发布"。语音价格战刚开打,省钱党再等等,只会更便宜。哔哩哔哩

语音这一仗,模型下饺子,榜单一天一换。但对普通用户来说,先分清楚哪款是给企业客服算账的、哪款是给办公场景干活的、哪款你现在打开 app 就能用——比追每一个"第一"重要得多。

内容由AI生成

精选参考来源

1. 语音大模型开战,Gemini3.8Live把价格打到OpenAI十分之一,中国模型屠了三个榜

2. #AI模型大战##人工智能##科技圈太卷了#9月刚过两周,AI圈已经上演了一出"模型流星雨"。OpenAIGPT-6Astra、AnthropicClaudeFable5.1、GoogleGemini3.8Flash、MetaMuseSpark1.3、SakanaFuguUltrav2、CognitionSWE-2、DeepSeekFlashv4.1……7家公司13天扔了11个前沿模型出来。一年前大家...全文

3. 深度拆解 Gemini 3.8 Live:一句插话,为什么会牵动整个 Agent 系统

4. 便宜四倍,完成率却差38.5个百分点:Gemini双模型怎么选?

5. 谷歌凌晨把"边说边干"做出来了:Gemini 3.8 Live 到底强在哪,又藏着什么坑

6. 【#谷歌发布Gemini3.8Live#:语音对话成本约为GPT-Live-1一半】谷歌谷歌于9月15日通过官方博客宣布,正式推出实时语音模型Gemini3.8Live与Gemini3.8LiveExtendedThinking,两款模型均经由LiveAPI向开发者开放,主打实时语音交互场景。第三方测算显示,其一小时语音对...全文

7. 【#阶跃发布StepAudio3系列语音大模型#,拿下多个全球第一】阶跃今日正式发布StepAudio3系列模型,涵盖实时语音交互、语音识别、语音生成等五大产品,多款在ArtificialAnalysis榜单中排名全球第一。目前五款模型均已上线阶跃星辰开放平台。这标志着AI语音交互能力迈向新台阶。#AI语音新突破#

8. 阶跃星辰发布StepAudio3系列语音大模型:五款模型,多款登顶ArtificialAnalysis全球第一9月15日,阶跃星辰发布StepAudio3系列语音大模型,包含Realtime、ASR、TTS、Gen、Music五款,均已在阶跃星辰开放平台上线。官方数据:StepAudio3Realtime在ConversationalDynamics评测以98.9%综...全文

9. #阶跃星辰##StepAudio3##语音大模型##ASR##全双工#【行业动态:阶跃星辰发布StepAudio3系列五款语音模型,Realtime在两个榜单全球第一、ASR词错率1.7%】阶跃星辰9月15日发布StepAudio3系列,包括Realtime、ASR、TTS、Gen与Music五款模型,分别面向实时语音交互、复杂场景语音理解、真人级语音生成...全文

10. 豆包打电话,能力再升级

11. 豆包新通话功能来啦,目前已经开始内测!

12. OpenAI本周将有重磅发布;Gemini3.8Live成最强语音模型;ChatGPT联合发明人发布Jev【09-16AI资讯】

2
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章