这个周末,用DeepSeek的人分成了两种:一种突然在App右上角发现了小喇叭,点开之后激动宣布“哑巴老公终于会说话了”。另一种反复刷新了三天,还是只能对着那只沉默的蓝色鲸鱼logo干瞪眼。小红书
9月12日起,DeepSeek App开始灰度测试语音功能,小红书上助眠帖、男声花痴帖、让AI念诗的帖子一夜之间冒出来;微博上#DeepSeek开口说话了#挂着热议,B站全是实测视频。但热闹背后,一个关键的误读正在扩散——很多报道标题写的是“语音对话”,而第一批用户实测下来,它现在其实是个朗读器。这两件事差别很大,直接决定你该不该激动。
先把时间线捋直:这一周AI圈都在“长嘴”
把这几天的事排在一起看,会发现DeepSeek开口不是孤立事件:
9月10日:DeepSeek发布V4.1 Flash,性能超自家旗舰,价格按Flash档收,同步开源、下线旧模型——“用Pro的能力收Flash的钱”。36氪
9月12日:DeepSeek App灰度语音,对话页右上角出现小喇叭,设置里新增“朗读音色”,四个可选:贝壳(百变活泼)、白浪(明朗坚定)、海星(俏皮甜美)、暗潮(低沉浑厚)。微博
同一时间窗:微信的AI助手“小微”开始灰度,支持按住语音输入和图片AI处理。OpenAI把全双工实时语音模型GPT-Live-1开放进API,语音前端0.05美元/分钟。小米也开源了能靠声纹锁定说话人的CocktailASR-1。知乎微博
一周之内,四家同时押注语音。这不是巧合,是入口之战打到了最后一块阵地。

最关键的祛魅:现在灰度的是“朗读”,不是“对话”
先把最重要的事说清楚。多个信源和第一批用户的实测拼起来,DeepSeek这次语音的形态是:你先提问,模型写完文字回答,再点喇叭,用选定音色念给你听——本质是TTS朗读,“先写完再念”。它目前不能边听边说,你也没法打断它。有少数用户反馈摸到了“双工模式”的测试入口,但那不是主流形态。官方目前既没公布全量时间表,也没开放语音API。小红书小红书
对照一下就知道差距在哪:OpenAI上周开放的GPT-Live-1是真正的全双工——单一模型同时听和说,能处理打断、停顿和背景噪音,官方给出的早期评估里,语言学习者被抢话的情况比上一代轮流对话系统少了近八成。那才是“打电话式聊天”。微博
所以结论很简单:想跟DeepSeek实时唠嗑的,现在会失望;只想“听答案”而不是“看答案”的,已经能用了。
第一批用户的真实口碑:两极,但两极得很有道理
翻遍微博、小红书、B站这三天的实测内容,好评和差评出奇地泾渭分明:
真香的场景:
助眠和深夜陪伴:小红书上“助眠好AI,记得带耳机”的帖子评论区比正文还热闹,暗潮那个“深夜电台感”的低沉男声被反复点名。小红书
男声出圈:那条“哑巴老公终于会说话了”的帖子点赞收藏一路涨——DeepSeek的用户里,情感陪伴需求比大家想象的大得多。
听诗、听长文:“终于不用复制过去让豆包念给我听了”,这条吐槽精准概括了此前的痛点:DeepSeek文字质量高,但想听只能靠别家TTS中转。还有人让AI自己挑一首最想读的诗,它思考了半分钟,选中了用户喜欢很多年的诗人和诗。小红书小红书
意外细节:有B站用户发现语音朗读会根据上下文自动换语气,还支持多语种。哔哩哔哩
翻车的场景:
长句生硬,被形容“像念稿”;唱歌必跑调,被总结成“劝退用户的致命伤”。让它唱《生日快乐》,跑调跑成了梗;播放量最高的实测视频是网页版语音合成的《恋爱循环》,评论区一片“难绷”。微博哔哩哔哩
音色不稳定:有用户反馈“每次播放声音都不一样”,灰度版本的品控可见一斑。小红书
不能打断:说错话想拦都拦不住,只能等它念完。
四个音色怎么选,综合第一批用户的反馈给你一张速查表:日常闲聊选贝壳,听报告、听逻辑长文选白浪,陪聊解闷选海星,深夜助眠直奔暗潮。

至于找不到小喇叭的:先确认App更新到最新版,然后看对话页右上角和设置页。都没有就是没被灰度命中,不是手机坏了也不是账号坏了,官方目前就是随机推送,急也没用。小红书
为什么偏偏是现在?模型不赚钱,DeepSeek需要一个“入口故事”
单看功能,语音朗读不新鲜——豆包、元宝、GPT早都有。但放在DeepSeek自己的时间线里看,这一步的意图相当清晰:
第一,模型端刚把利润让完。V4.1 Flash这次换代幅度大到“推倒重来”——新的非对称结构把每个token的KV缓存压到890字节,只有上一代的四分之一,长文本缓存的硬盘占用暴降88%。技术上漂亮,商业上的直接效果是把推理成本打到行业底部。连财经媒体都直接发问:DeepSeek想赚钱,最大的对手却是自己。模型端让利到这个地步,增长就得从用户端找。36氪

第二,资本市场在等着看C端故事。DeepSeek正备战科创板IPO,新CFO也即将到岗。上市叙事里,“全球开发者都爱用的开源模型”不如“几亿普通人每天都打开的入口”值钱。模型同质化的时代,谁抓住入口,谁才握有增长故事——新版模型甚至是围绕自家Agent产品反向定制训练的,产品闭环已经成了模型迭代的一部分。语音,就是把“打字工具”变成“随身陪伴”的那一步。36氪
第三,对手全在门口了。豆包的实时语音早已成熟到有人天天拿它当电台;微信小微虽然还在灰度,但它背后是十亿级入口;OpenAI干脆把全双工语音按分钟卖给了开发者,0.05美元一分钟,约合一小时21块。DeepSeek再不“长嘴”,用户耳朵就要被别人占领了。微博
该冲还是该等?三类人三个答案
如果你是DeepSeek文字党(写材料、查资料、聊天为主):灰度到了就直接用,把四音色当免费有声书播放器,暗潮助眠、白浪听报告,白嫖不亏。没灰度到也不必折腾——朗读不改变文字能力,你的DeepSeek没有变弱。
如果你是语音重度用户(要的是随问随答、能打断、像真人聊天):现在别急着搬家。DeepSeek这一步补的是“能念出来”,实时对话还没影。当下要全双工体验,豆包更成熟,GPT-Live-1更强但要付费和网络条件。
如果你是开发者:语音API还没开放,等。可以先拿GPT-Live-1的0.05美元/分钟当定价锚点——将来DeepSeek开语音API,大概率往这个价的下方向卷。小红书
接下来值得盯的信号:全量推送时间表、“双工模式”会不会扩大测试、语音API开不开放、微信小微的语音做到哪一步。这四个里任何一个落地,语音AI的格局都会再动一次。
最后说句实在的:这次DeepSeek的语音,功能本身只值三星——TTS朗读,2026年了才补上,还有品控毛病。但它释放的信号值五星:那个最不爱做产品的DeepSeek,开始认真抢普通人的耳朵了。梁文锋都下场抢入口了,接下来卷成什么样,咱们戴着耳机看戏就行。