每小时0.54美元:微软流式转录第一,是非流式的5倍
2.50%的词错误率,0.13秒的延迟,微软的新模型拿下了流式转录榜单第一的位置。
但更值得看的数字是它的定价:每小时0.54美元。同一家公司几乎同名的非流式版本,每小时0.10美元。
流式的价格是它的5倍多。这多出来的钱买到了什么,又没买到什么,值得说清楚。

一句话说清:它是边听边说,不是听完再写
10月1日,微软AI一次发了三款语音模型:MAI-Transcribe-2-Streaming、MAI-Voice-2.1,以及它的高速版MAI-Voice-2.1-Flash。三款都在Microsoft Foundry上以公共预览的形式提供,Foundry之外还能在MAI Playground、OpenRouter、Vercel这些渠道试到。
前一个是语音转文字,后两个是文字转语音。真正的新东西是第一个:它是微软的第一个流式转录模型。
转录这件事分两种做法。非流式是把一段录好的音频丢进去,等模型把整段处理完,一次性把文字交出来。流式是音频一边送进去,文字一边出来,没说完的句子先给一版不完整的稿子,之后不断改,说到某个位置再定稿。
微软上一个转录模型MAI-Transcribe-2走的是前一条路。这次的区别不在准确率,在时间。
流式模型支持60种语言,并且能自动、连续地判断语言。这一点比听上去重要:真实场景里一段会议既可能中英混杂,也可能中途换人换语种,要求用户开场前先指定语言,等于把问题推给了使用者。
2.5%和0.13秒,是两个不同时刻的数字
先把这两个数字的来处说清楚,它们经常被当成同一件事。
2.50%是最终词错误率,0.13秒是最终延迟。
换成日常说法:在一句话结束、这段文字被确定为最终结果之后,它的错词率是2.50%;而模型从话音结束到交出这个最终结果,用了0.13秒。
拆开看这套流程。音频不是一整块进来的,是被切成小块持续送进模型的。每进来一块,模型先给一版临时文字,这版文字在100多毫秒内就会出现;微软自己的实时评测里,文字最快在语音出现后约320毫秒显示出来。随着上下文越攒越多,这些临时文字会被反复修改,直到句子结束,模型提交一个它认为稳定的版本。
关键就在这里:2.50%算的是最后那一版,0.13秒算的是最后一版出现得有多快。你在屏幕上看到的那一版临时文字,不在这个指标里。
这不是微软一家的问题,是所有流式转录模型共用的度量方式。最终结果的指标天生好看,中间稿的指标难看得多。行业公开的排行榜也很少把"中间改了几次、改错了多少"单独摆出来。
榜单的对比对象倒是清楚。Artificial Analysis在9月28日发布的流式语音转文字排行里,排在微软后面的是Grok Voice Transcribe 2.0 Streaming的2.73%,再后面是ElevenLabs Scribe v2 Realtime的3.59%。
前两名之间只差0.23个百分点。
这个差距的意思是:领先是真的,但没有代差。选型的时候把"榜单第一"当成一个加分项,而不是一个必须换的理由,会更理性。
每小时0.54美元,是非流式的5倍
再看价格。MAI-Transcribe-2-Streaming目前的优惠价是每小时音频0.54美元,折合约每1000分钟9美元。
而微软的非流式模型MAI-Transcribe-2,在Azure Speech公共预览阶段的价格是每小时0.10美元。
同一家公司、同一个任务,只因为多了"实时"这两个字,价格差了5倍多。
有人可能立刻想到"因为流式的更准"。这个推论在这里不成立。非流式那个模型对外给出的成绩是60种语言平均词错误率5.2%,看着比2.50%差不少,但这两个数字来自不同的评测集、不同的语言构成,放在一起比较没有意义。两个模型之间真正的差别是交付方式,不是准确率的档位。
真正撑起价差的是算力占用方式。非流式可以攒批:一百段录音一起送进来,服务器塞满算力跑一轮就行,机器不用为某一路音频空等。流式做不到,每一路音频都要保持一个活着的会话,说话人下一秒说不说、还要说多久,服务端都不知道,但算力得占着。按音频时长计价,实际是在为这段占用时间付费。
还有一层容易忽略:0.54美元属于"年末前的引入价"。正式价格没有公布,做预算的时候按这个数字算,等于把优惠当成了常态。
放到场景里:0.13秒能换来什么
延迟这个数字,只有在具体场景里才有意义。
放到客服智能体里看。用户说"我上个月买的那台……",句子还没结束,流式模型已经识别出他在讲一台具体商品。系统可以提前去查订单,等用户说完"能不能退",答案已经准备好了。非流式做不到这一点,它必须等这句话说完才开始处理。
放到实时字幕里看。字幕要贴着声音走,观众才能跟着看。0.13秒的最终延迟意味着字幕不会明显落后于口型,在直播、会议、课堂这类场景里,这是可用与不可用的区别。
反过来看会议记录。录音转文字是典型的"整段放在一起处理"的任务,说话人不需要中途看到文字,也不需要系统提前反应。这类任务用非流式,成本只有流式的五分之一左右。省下来的钱不是抠出来的,是任务本身不需要实时。
这里有个容易忽视的物理限制:人说话本来就带停顿,句子中间的空隙常常有好几百毫秒。所谓实时,本质是让模型在信息还不完整的时候先下判断,然后不断修正自己,而不是让模型瞬间看完整句话。这也解释了为什么中间稿的准确率天然低于最终稿。
最容易看错的几件事
说法一:2.5%的词错误率,意思是一百个字错2.5个字。
这个说法在定义上没错,词错误率确实是错词数除以总词数,数值越低越好。但它解释不了一件事:这个2.50%是最终结果的成绩。实时字幕里先出现的那版文字会被改写,观众实际看到的中间状态并不能保证同样的错误率。更准确的理解是,把2.50%当成这套系统的下限,而不是你眼睛看到的平均状态。
说法二:既然是榜单第一,现在就该把项目切过去。
这个判断有现实支撑,2.50%的最终错误率和0.13秒的最终延迟,确实是目前公开成绩里最好的。但它解释不了部署条件:模型处在公共预览阶段,官方文档明确写着没有服务等级协议,也不建议用于生产负载。更准确的理解是,它的位置是"目前能买到的最好的实时转录",不是"所有转录任务都该换成它"。真要上生产,得先准备好一条降级路径。
说法三:同一家公司的模型,贵的那个一定更强。
这符合一般直觉,型号更新、价格更高通常对应更强的能力。但它解释不了价差结构:流式贵,贵在状态保持和并发占用,不在于模型本身高一个档。同一代的非流式版本便宜,是因为它可以把算力攒起来用。更准确的理解是,这5倍价差买的是"不攒批",是交付方式的溢价。
真要选型,先回答四个问题
如果你想知道手上这类活该不该用流式转录,可以按下面四条过一遍。任一条答不上来,就先别急着迁移。
一是结果需要在对方说话的过程中被使用吗。比如提前触发工具调用、实时翻译、边听边生成待办。需要,流式才有意义;只是事后归档,非流式更划算。
二是按小时计费的成本能不能覆盖业务价值。0.54美元一小时的音频,折算成每分钟不到一分钱,量小的时候无感,量上去之后是一条实打实的成本线,而且它还是优惠价。
三是出错时有没有人复核、有没有回退方案。公共预览无服务等级协议,这不是危言耸听,是官方文档的原话。降级方案是必须项,不是可选项。
四是你能接受中间稿被改写吗。实时字幕在屏幕上跳动是设计的一部分,不是故障。下游系统如果按"每来一段文字就写库"的方式设计,会被改写搞乱,需要先想清楚覆盖与幂等逻辑。
这四条不是门槛,是边界。过了这四条,流式的价值很清楚;过不了,非流式或者直接用成熟的云服务往往更稳。
接下来值得盯的不是榜单
发布当天的名次会被很快刷新,真正的变量在后面几个地方。
价格什么时候从引入价转成正式价,转完涨多少。中间稿的准确率指标会不会被公开,如果公开,那才是能真实对比实时体验的时刻。并发和限流怎么设定,实时服务最怕的不是单次慢,而是高峰期排队。
语音合成那两个模型同样值得留意边界。从几秒参考音频里复刻音色这个功能,需要用审批过的访问权限,系统也要求只能合成获得本人同意的声音。这条限制放在今天的环境里成立且必要,它同时提醒使用者,音色复制不是随手可用的默认能力。
回到最开始那个数字。2.50%和0.13秒都是好成绩,但真正决定你要不要用的,是每小时0.54美元能不能换回对应的价值,以及在一个没有服务承诺的预览期里,你敢不敢把它放在关键链路上。
如果你的会议记录从明天起快10秒,但准确率掉一点点,你换不换?
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
