如果你现在还觉得「语音转文字」就是装个 Whisper——OpenAI 那个免费转写神器——那你的信息大概停留在两年前。
这半年我一直盯着这个圈子,发现一个有意思的现象:一边是「Whisper 本地部署」的教程还在批量出现,另一边,真正重度使用的人已经在悄悄换模型了。有人把会议系统里的 Whisper large-v3 Turbo 整个换成了 Qwen3-ASR,有人投奔阿里的 FunASR,张口就是「比 Whisper 快 170 倍」,还有人做中文语音输入,已经彻底不用 Whisper。
那 Whisper 是不是过时了?并没有。但「本地转写 = 装 Whisper」这个等式,确实已经不成立了。今天把 2026 年值得考虑的几条路线一次讲清楚,看完你能按自己的电脑和用途,选出该装哪个。
先纠正一个最多人搞错的认知:Whisper 是模型,不是软件
Whisper 是 OpenAI 开源的一系列语音识别模型,代码和权重都是 MIT 协议,官方发布的 large-v3 覆盖 99 种语言。知乎你平时「装 Whisper」,实际装的是三层组合:
模型层:Whisper large-v3、large-v3-turbo,以及 FunASR Paraformer、SenseVoice、Qwen3-ASR 这些挑战者;
推理引擎层:官方 Python 包、faster-whisper(CTranslate2 加速)、whisper.cpp(C++ 实现,Mac 和纯 CPU 机器都能跑);
工具层:Buzz、MacWhisper 这类图形界面软件,甚至直接在浏览器里跑的版本。

所以你看到有人说「Whisper 巨慢」,大概率是在 CPU 上跑官方 Python 包;说「快得飞起」的,用的可能是 faster-whisper 或 FunASR。看测评先搞清楚对方说的是哪一层,能少走很多弯路。
Whisper 在 2026 年的真实水平:长板还在,短板也很明确
先说长板。在所有开源方案里,Whisper 的语言覆盖面仍然是最广的,而且是为数不多能顺手做「语音翻译成英文」的,生态也最成熟,几乎所有字幕工具都支持它。
但中文场景里,它的短板被社区反复验证过:
小模型基本不能用于中文。tiny 和 base 级别跑起来确实快,但中文识别基本没法用,大量错字、漏字、奇怪的断句。知乎medium 勉强能用,遇到专业术语和人名经常翻车,中文基本只能上 large-v3,代价是速度——M 系列 Mac 上 10 秒语音要处理 3 到 4 秒。
原始输出没有标点,中英混合偶尔抽风,三五个字的短语音准确率也会明显下降,想要可读的文本,得再拿大模型过一遍做整理。
粤语和方言是软肋。有用户整理片库时发现,Whisper 总是把音轨里的粤语识别成普通话,而且按官方说法 large-v3 应该支持粤语,实际效果却不理想。知乎
嫌慢的话,至少把引擎换成 faster-whisper 或 whisper.cpp。faster-whisper 是 SYSTRAN 用 CTranslate2 重写的推理层,CPU 上比原版快 4 倍左右,还支持 int8 量化。知乎同一个模型,换个引擎,速度差出几倍是常态。

来势汹汹的挑战者:FunASR / SenseVoice
如果你的主力需求是中文会议录音、课程录音,这一系值得认真看。核心卖点有两个。
第一,快。 Paraformer 用的是非自回归架构——Whisper 像逐字听写的秘书,听一个音写一个字;Paraformer 是先听完整句,再一次性写出来。SenseVoice 的小尺寸版本同样采用非自回归端到端框架,主打低延迟推理。GitHub社区在 28 核 Xeon 服务器上实测,1 小时的音频,FunASR 在 GPU 上 21 秒跑完,CPU 上 3.5 分钟跑完。知乎作为对照,原版 Whisper 在 CPU 上处理 1 小时音频要 1.5 小时左右。「快 170 倍」的说法就出自这类高配环境实测,你的家用电脑别指望同倍数,但量级差距是真实存在的。
第二,输出全。 Whisper 只给你一锅文字,FunASR 一次调用,能同时告诉你说了什么、谁说的、带着什么情绪、背景里有什么声音。知乎对会议纪要来说,标点、说话人分离这些能力,等于直接出「谁说了什么」的初稿,不用回头反复对录音。

SenseVoice 分 Small 和 Large 两个版本,小版本主打速度和离线部署,大版本带自回归解码器拼精度,官方基准里中文识别的字符错误率已经能和 Whisper 大尺寸掰手腕。另外它原生支持普通话、粤语、英语、日语、韩语的识别,还带情感和声音事件标签。GitHub小模型体积只有几百 MB,CPU 就能跑,这些都是 Whisper 没有的特性。
当然它也不是免费的午餐:语言覆盖没有 Whisper 的 99 种那么广,粤语之外的方言效果一般,部分完整能力组合还需要 GPU。
Qwen3-ASR:今年的工程派新选项
阿里的 Qwen3-ASR 有 0.6B 和 1.7B 两种规模,支持语言识别、长音频、流式和离线推理,官方列出的覆盖范围是 52 种语言和方言。知乎它最大的特点是流式和离线统一——实时会议字幕和录音文件批处理,可以用同一套模型。
已经有生产环境的真实迁移案例,把会议系统的 ASR 从 Whisper large-v3 Turbo 整个切到 Qwen3-ASR,动机并不是原模型不能用,而是中文会议和方言语音占比逐渐提高。知乎不过要提醒一句:它偏工程向,流式要走 vLLM 后端,时间戳还得再配一个对齐模型,文档是写给搭系统的团队看的。只想转几段录音的轻度用户,有点杀鸡用牛刀。
不想装环境?零配置路线也有
不是所有人都想碰命令行,零配置路线现在有三类:
Buzz:开源的 Whisper 图形界面,跨平台,把音频拖进去就能出文字和字幕,适合偶尔用一次的人。
MacWhisper:Mac 专属,最近的 1.4 版本新增了编辑器视图、优化了 CPU 占用,而且已经支持在本地运行 OpenAI 的 Whisper 和 Nvidia 的 Parakeet 等模型。知乎
浏览器本地版:靠 WebGPU 在浏览器里直接跑 Whisper 模型,页面明确标注音频不上传服务器,不用装任何东西。知乎缺点是首次要等模型加载,精度也有限,适合短录音出粗稿,敏感内容图个安心。
直接给选择结论
按用途选:
会议录音、要分清谁说了什么 → FunASR(paraformer-zh),标点、说话人分离开箱即用,CPU 也友好;
多语言内容、要翻译成英文 → 还是 Whisper large-v3,引擎用 faster-whisper 或 whisper.cpp 提速度;
语音输入替代打字 → SenseVoice + 本地小参数 LLM 做整理,这套组合已经有现成开源工具,中文体验比 Whisper 稳;
粤语录音 → 优先 FunASR 系,粤语有专项支持,Whisper 容易判错语种;
视频做字幕 → 两条路线都行,但记得流程里留人工校对这一步,识别只是流水线的第一步。
按电脑选:
没有 NVIDIA 显卡,核显或纯 CPU → FunASR/SenseVoice 系,或 faster-whisper 开 int8;
有 N 卡 → Whisper large-v3-turbo,速度精度都在线;
Mac(M 系列) → whisper.cpp 或 MacWhisper,体验最顺;
什么都不想装 → Buzz 或浏览器本地版。
踩坑备忘(都是别人真金白银踩过的)
转中文记得显式指定 `language=“zh”`,让它自己猜语种,速度和准确率都会吃亏;
CPU 上选 int8 量化,会议录音打开 `vad_filter=True` 自动跳过静音,省的时间非常多;
给 `initial_prompt` 传一句「以下是普通话的会议记录」,中文标点和断句会明显改善;
敏感录音别上传任何在线工具——会议、访谈录音涉及真人真事,本地方案是唯一踏实的选择;
Whisper 输出没标点,预留一道 LLM 整理工序再交付,直接拿原始输出会很难读。
值得继续盯的信号
最后说下趋势。本地转写这个领域正处在密集迭代期:Qwen3-ASR 用 0.6B 的小身材就敢进会议场景,MacWhisper 开始接入 Nvidia Parakeet,云端转写 API 还在持续降价,知乎上甚至出现了「单价骤减 90%」的讨论。知乎

竞争方向也已经从「谁识别得更准」变成「谁识别得更多」:新一代模型把情感识别、声音事件当成标配能力,SenseVoice 官方甚至宣称其情感识别在测试数据上达到并超过了当前最好的情感识别模型。GitHub
所以不用争「谁是最强」,模型只会一直更新。真正值钱的姿势,是把模型和你的工作流解耦——会议纪要也好、字幕流水线也好,把 ASR 包成一个可替换层,出新模型时改一行配置就能换上。这是今年这场迁移大战里,最值钱的一条经验。