202种方言免切换、推理成本只加10%:Spark-ASR-2.0发布后,转写党按设备分四档,先弄清你的机器排在哪一队

源自210位全网作者

17:40

这两天,用讯飞系产品做语音转写的人,朋友圈和技术群都在传同一件事:9月23日,科大讯飞把新一代语音识别大模型Spark-ASR-2.0发布了出去,官方口径是从9月24日起逐步上线讯飞输入法,同时讯飞开放平台的API已经可以提供服务。 而讯飞AI眼镜、智能办公本、讯飞听见这些硬件和应用,官方说的是"陆续落地"——没有时间表,官方同时给出的承诺是"明日起将逐步上线讯飞输入法等产品",效果宣称集中在中英文混合与方言等复杂场景。微博IT之家

202种方言免切换、推理成本只加10%:Spark-ASR-2.0发布后,转写党按设备分四档,先弄清你的机器排在哪一队

对天天靠语音吃饭的人来说,“发布了"三个字不值钱,值钱的是"我的设备哪天能用上、要不要为它改变双11的购物计划”。这篇就把这件事拆开算清楚。

先说这次升级真正改掉了什么。智东西9月24日拿到体验资格做了一轮实测,四个维度的结果可以对上官方宣称:方言这块,河南话刚说完几乎同时出字,官方称现在支持全国202种方言免切换识别——注意是"免切换",过去很多转写工具要你先手动选方言模式,这一步被砍掉了;中英混合这块,一段塞了RISC-V、TPU、VISA的芯片业务介绍没有写错专业词;噪声这块,地铁背景音下"一号线""东单"这类关键信息完整转了出来,压低音量说气声也能识别。智东西

但真正值得停下来看一眼的是第四个维度:口语成文。实测里,停顿、重复、临时改口会被模型自动删掉理顺,说错的会议时间被修正成"8点半",邮箱、取件码、快递单号按规范格式原样输出。为什么这个才是分水岭?因为上一代转写模型的普遍状态是"转得准,但没法直接用"——一场一小时的会,录音转完还得自己从头捋一遍语气词和改口,所谓"转写完了但活儿没完"。把散会后的二次整理压到接近零,这才是打工人真正感知得到的变化。技术上它靠的是非自回归先快速出一版全文、再用投机解码判断哪里需要结合上下文修正的混合架构,官方给的数字是整体推理成本较ASR-1.0只增加10%——这个数字很重要,后面会用到。智东西

202种方言免切换、推理成本只加10%:Spark-ASR-2.0发布后,转写党按设备分四档,先弄清你的机器排在哪一队

然后泼三盆冷水,这是判断"等不等"之前必须知道的边界。

第一,"绝大多数场景WER(词错误率)低于业界最优水平"是官方自己测试集的口径,目前没有第三方独立复测。 第二,多人同时说话的叠音场景,这次发布和实测都没有展开讲——而会议室恰恰是转写需求最密集的地方,CHiME"鸡尾酒会"难题讯飞拿过六届冠军不假,但新模型在这个场景的表现要等实测。第三,也是最关键的:模型主要活在云上。推理成本增加10%意味着云端部署可行,但你的录音笔、办公本主打的恰恰是离线转写——ASR-2.0什么时候、以什么形态落到哪台设备上,是云转写还是端侧,官方一个字没提。智东西

202种方言免切换、推理成本只加10%:Spark-ASR-2.0发布后,转写党按设备分四档,先弄清你的机器排在哪一队

所以按设备把人分成四档,各做各的决策。

第一档:讯飞输入法用户。现在就能动手,模型已从9月24日起逐步推送,免费。微博上有用了十几年讯飞输入法的老用户在9月14日吐槽语音转文字老是出错别字,连"甑糕"两个字都打不出来。 这类用户更新完App后用自己的高频词测一轮,是目前全网成本最低的验货方式。微博

第二档:讯飞听见App用户。官方在"后续落地"名单里点了它,但没给日期。续费年度会员不急着这几天操作,等推送公告落地、确认转写引擎换代之后再续不迟——除非你下周就有大场次要转,那就先用起来,体验归旧引擎,钱不算白花。

第三档:正在双11前看录音笔、智能办公本的人。这是最需要冷静的一档。这类硬件的核心决策要素是形态(墨水屏、磁吸录音卡)、续航、离线转写权益这三件事,ASR-2.0目前不构成"现在就下单"的理由,也不构成"必须再等等"的理由——因为官方没承诺换代时间表。反过来,如果你原本就是因为"听说模型要升级"才在观望硬件,那这个理由暂时兑现不了,等它变成白纸黑字的固件公告再做决定不晚。另外小红书搜"讯飞"你会刷到大量学习机营销打卡帖,而真实吐槽帖——“录音笔蓝牙一万年都连不上,还骗我可以语音转文字”“耳机转写实测很失望”——点赞都只有个位数,这说明转写硬件的口碑水分不小,下单前一定用自己的场景试,别信评论区。小红书

202种方言免切换、推理成本只加10%:Spark-ASR-2.0发布后,转写党按设备分四档,先弄清你的机器排在哪一队

第四档:开发者和企业用户。开放平台API已经能调,如果你的业务在阿里云9月6日发布的fun-asr 1.5和开源方案之间犹豫过,现在可以拿同一段带噪、带术语的真实音频横向跑一轮再定价。 这也是九月这波"语音大模型开战"(9月15日Google发布了Gemini 3.8 Live语音模型)里少数立刻可执行的选项。知乎知乎专栏

最后一个继续观察的信号:2025年讯飞就是在1024开发者节上首发的上一代Spark-ASR-1.0。 今年的1024月底就要开了,官方新闻稿里那句"后续规划中的系列语音相关大模型"基本是在预告议程。办公本、录音笔、听见什么时候吃到ASR-2.0,大概率要在那之前给出时间表——双11前想买讯飞硬件的人,把它当成一个免费的前置提醒就行。智东西

一句话收口:输入法用户今天就去更新,听见用户缓一缓续费的脚步,双11的硬件党别让一个没承诺时间表的模型替你下单,开发者现在就可以开测。这次升级真实存在,但轮到你设备上,还得排队。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章