如果你最近半年没关注语音转文字这个圈子,可能会错过一场安静但彻底的大洗牌。
先说我是怎么注意到这件事的:最近翻知乎,8 月 21 日还有人在认真讨论语音输入法该选哪家引擎,给出的理由是 Whisper-large-v3 系在中英混说场景依然是公开模型里最稳的。知乎 但几乎同一时间,小红书、B站里冒出来的新名字越来越多——Cohere Transcribe、MiMo-V2.5-ASR、GPT-Transcribe、Granite 4.1。老用户在纠结要不要换,新用户在纠结从哪个入门。
我把知乎、B站、小红书最近几个月的讨论和实测翻了一遍,帮大家把这事理清楚。这篇是写给“知道 Whisper、用过或正准备用、但被一堆新模型名字搞花眼”的朋友的。
先给结论
Whisper 没有过气,但它已经从“无脑默认项”变成了“分场景的最优解之一”。
用一句话概括现在的基本盘:要省心、要多语言、要中英混说,Whisper 依然是第一选择;要中文纯语音的高准确率,或者要极致速度,2026 年已经有更值得试的选项了。
这半年到底发生了什么
按时间线捋一下,信息量其实很密集:
3 月底,Cohere 发布开源转录模型 Transcribe。 这款模型只有 20 亿参数,相对轻量,专为希望自行部署的用户设计,可在消费级 GPU 上运行,目前支持 14 种语言。知乎 它以 Apache 2.0 协议开源、可本地部署,官方给出的成绩里,它在 HuggingFace Open ASR Leaderboard 上平均词错率 5.42%。哔哩哔哩 B站有实测视频直接喊出“完胜 Whisper large-v3”。哔哩哔哩

4 月 23 日,小米随 MiMo-V2.5 系列发布了 MiMo-V2.5-ASR。 知乎 5 月初有一篇很扎实的横评,作者测了市面上几乎所有主流中文语音转文字模型,结论是 MiMo-V2.5-ASR 排第一,而曾经开启这一领域的 Whisper-Large-v3-turbo 暂时垫底。知乎 注意,这是单一作者的实测结论,样本是他的测试集,不是行业公论,但方向上和其他信号是吻合的。
5 月,IBM 发布 Granite 4.1 语音模型。 B站有实测视频,主打一个快:基础版 1 小时音频只要 16 秒就能转完,Plus 版还带说话人识别和时间戳。哔哩哔哩
7 月 29 日,OpenAI 自己下场更新。 官方推出两款新语音转录模型:GPT-Live-Transcribe 和 GPT-Transcribe。小红书 官方口径是新模型的错误率大幅降低。也就是说,Whisper 的亲爹把转录这件事推进了 GPT 时代——不过走的是 API 收费路线,跟本地开源是两条路。
7 月底,工具链开始跟进。 语音听写工具 Superwhisper 把 Cohere Transcribe 接入了引擎选项。小红书 小红书上有用户实测,Cohere Transcribe 本地跑大概占 6GB 显存。小红书
那 Whisper 凭什么还没倒
看了上面的时间线,你可能会问:被四面夹击,Whisper 怎么还在各种教程和工具里当默认项?
答案不是情怀,是生态和长板:
第一,工具链厚到没人能比。 whisper.cpp、faster-whisper、WhisperX、Buzz、MacWhisper、Superwhisper、OpenCut……你能想到的平台、你能想到的用法,基本都有现成封装。新模型就算指标再好看,想从零攒出这套生态,没那么快。

第二,中英混说依然稳。 这也是很多语音输入法坚持用 Whisper 做引擎的原因:系统听写的短板恰好是它的长板,中英夹杂、口音模糊的场景,large-v3 系仍是公开模型里最稳的选择。
第三,99 种语言 + MIT 协议。 Whisper 的代码和模型权重采用 MIT 协议发布,可以在本地环境运行,large-v3 的公开模型卡覆盖 99 种语言,还附带语种检测和语音翻译成英语的能力。知乎 小语种转录、本地离线、隐私敏感场景,这个组合短期内没有替代品。榜单第一和适合你是两回事:Cohere Transcribe 登顶不假,但它目前只覆盖 14 种语言。
但 Whisper 确实有三个真实的坑
坑一:中文纯语音的准确率确实被超了。 前面提到的知乎横评里,Whisper-Large-v3-turbo 在中文测试里垫底。如果你的核心场景就是中文会议录音、采访转写,这个差距值得认真对待。

坑二:部署链路对新用户不友好。 就在 8 月 23 日,知乎还有帖子在问,编译 whisper.cpp 卡在拉取 llama.cpp 依赖那一行怎么办。知乎 社区里的字幕流水线教程也普遍要先装 ffmpeg、配 CUDA,门槛摆在那。
坑三:榜单太多,容易看花眼。 举个现成的反例:小红书有一篇“2025 最新 ASR 王者榜单”,说 Google Chirp 2 以 11.6% WER 断层第一。小红书 但 HuggingFace 榜单上 5.42% 就能登顶,11.6% 算什么第一?这类榜单混了云端 API 和开源本地模型,口径五花八门,直接抄结论很容易翻车。
一张表说清楚:你现在该怎么选
把讨论里反复出现的场景对号入座:
视频字幕、多语种内容 → Whisper large-v3(配 faster-whisper 或 WhisperX 提速度、加说话人分离),生态最全,坑最少。
中文会议记录、采访转写 → 优先试 MiMo-V2.5-ASR 或 Qwen3-ASR 这类国产模型,中文场景的针对性优化是 Whisper 比不了的;知乎 7 月已经有人把会议助手从 Whisper turbo 迁到 Qwen3-ASR-0.6B 并写了实战记录。知乎
英文为主、显卡一般(6GB 显存左右) → Cohere Transcribe 值得试,2B 参数轻量、消费级 GPU 可跑、Apache 2.0 可商用,但中文不在它的 14 种语言里。
中英混说的听写、输入法场景 → 还是 Whisper large-v3 系,这是它目前护城河最深的地方。
树莓派、旧电脑等边缘设备 → Moonshine 这类专为端侧设计的小模型,B站有实测:树莓派上就能实现毫秒级响应的离线语音识别,无需联网和 API。哔哩哔哩
完全不想折腾 → 直接用通义听悟、飞书妙记这类云服务,或者按量调 GPT-Transcribe API,省下的时间也是钱。

接下来值得盯的三个信号
小米 MiMo 3.0 系列。 知乎上关于 MiMo 3.0 的讨论里,已经有人预测这一代可能一次发布 4 款以上模型,其中就包括 ASR/TTS。知乎 如果属实,中文转写的格局可能还要再变一次。
Cohere Transcribe 会不会加中文。 它现在最大的短板就是语言覆盖,一旦补上中文,对 Whisper 的威胁会从榜单层面落到日常使用层面。
whisper.cpp 的依赖和部署问题能不能解决。 作为开源生态的地基,它的安装体验直接影响整个 Whisper 阵营的口碑。
最后说句实在话:工具这东西,不存在“必须马上换”,只存在“你的场景里谁更合适”。如果你的 Whisper 用得好好的、场景也没变,完全不用焦虑;但如果你是新入坑、或者正在被中文准确率折磨,那 2026 年确实是换个思路的好时机。
你现在在用哪个转写方案?踩过的坑或者私藏配置,评论区聊聊。