我用 4 组测试 看看韶音 OpenFit 2 AI 能不能替代录音笔
过去的十几年工作里,除了手机和相机之外,录音笔也算是我接触过最多、使用最频繁的数码产品了,
从过去单纯的录音,自己边听边写到最后开始有AI加入大大的提升转写的效率,
在媒体采访工作流中,录音笔在采访和活动中对我来说主要起到的是留痕的作用,
活动结束开始写稿子的时候突然想到老板们说的一句话,但是又不确定的时候,录音笔能确保得到准确的信息。

在传统的工作流中,我通常都是录音、回听、找重点和金句、记录时间点、整理逐字稿然后开始写稿子。
所以其实耗时间最多的并非是录音,而是录音之后要做的一系列的工作。
我经常会拖动录音的进度条来确认领导的抬头和名称,判断一句话前后有没有语境并猜测大概是什么词。
所以有时候为了找一句十几秒的内容,我大概要花一个多小时来来回回听很多次。

AI出现之后,我的工作流也发生了变化,主要还是效率上的变化。
录音、自动转写、搜索内容、摘要、整理。
转写出来的内容精确度越高,就能帮我节省下更多的检索时间成本。
所以如果录音、转写、翻译和摘要都可以由AI完成,那一副耳机是否可以替代我的录音笔呢?
这也是我这次想测试韶音OpenFit 2 AI的主要原因。
目前公开的信息显示,OpenFit 2 AI主要升级集中在录音、转写、翻译和AI总结等功能,
依旧保留了OpenFit 2的开放式耳挂结构,接入千问大模型,拥有海量真实场景语料库,擅长理解复杂专业语境,

拥有金融、法律、科技、医疗等12大行业词库,支持30类语种和19种方言。
先是一副 OpenFit 2,然后才是一台 AI 设备
我手上本身就有OpenFit 2这款耳机,而且也是我健身房锻炼主要佩戴的耳机,
OpenFit 2 AI的基础形态,是建立在OpenFit 2的基础上的,所以我觉得我没必要再花大篇幅的内容来讨论佩戴感受、三频等传统耳机评测项目。

我就简单拿几张对比图,从外观就能看除了上盖开孔之外,外观、佩戴形态都没有发生变化,
技术声音表现也没有明显的差别,开放式耳机那种保持环境感知体验同样被保留下来了。
这些基本盘当然重要,但它们不是这次评测的重点。

OpenFit 2 AI已经不止是一副拿来听音乐和接电话的开放式耳机了,千问大模型的加入让它开始承担录音、转写、翻译、摘要和写作等任务。

所以评测逻辑也需要跟着变化,当OpenFIt 2 AI开始承担信息记录工具的角色之后,它到底可靠不可靠。
这次评测,我只关心它靠不靠谱
要验证OpenFit 2 AI的可靠性,主要围绕很直接的四个重点,首先是能不能录得到声音,转写的精确度,AI能否识别出有几个人在说话,以及最终转写和翻译出来的内容能不能用。

录音笔的使用环境其实是非常复杂的,环境好点的课堂和图书馆甚至是会议室,基本上手机也可以录音,但是多人对话中会存在抢话、突然飙高音等情况,
录下来的声音是否能理解上下文的语境,除了普通话和英语之外,千问大模型据称能识别19种方言,那正好我们用上海话来试试看其方言的识别能力。

录音和转写只是一个过程,融入到工作流之后,我还要继续搜索、核对信息、摘要和写稿,
如果AI生成的内容还需要我逐句回到原始录音里去确认,那它节省的时间就没有我想象中的多了。
所以判断标准我不会选择普遍的“识别准确率”。
CER 比“识别准确率”更适合做这次测试
很多录音笔产品宣传都会以“识别准确率95%”作为卖点,问题是95%到底是什么概念?
是按字数算?还是词算?
如果同一句话里错了一个字,和整句漏掉,在这个数字里又分别占多大权重?
所以为了尽可能地客观测试OpenFit 2 AI的转写能力,我会采用CER(字错误率)。
它的计算方式是:
CER =(替换错误 + 删除错误 + 插入错误)÷ 参考文本长度
CER数值越低越好,CER为0%则意味着转写文本与人工校对标准稿完全一致。
当然,作为媒体相关工作不能只看CER,因为如果一段2分钟的录音里只错了几个字,整体CER可能并不高,但其中企业名称、领导抬头、领导名字错了的话,对于写稿是有致命性伤害的。

所以除了CER,我会单独统计企业名称、领导抬头、领导姓名、金额、日期、百份比和英文缩写的错误。
将这两个指标分开来看。
发布会现场:AI 耳机和专业录音笔正面对比
第一组测试样本使用的是在我韶音OpenFit 2 AI发布会现场的录音素材,
同一场发布会、我正巧坐在最后一排、同一个演讲人和同一个时段,OpenFit 2 AI和我平时使用的专业录音笔同时录制。

同样录制的一段1分54秒的现场录音,韶音OpenFit 2 AI录音文件容量为666KB,录音笔的录音文件容量为121MB。

韶音OpenFit 2 AI在综合响度方面比专业录音笔高4.6db,更直接也更容易听清。同时韶音OpenFit 2 AI背景音比录音笔低了7db,韶音OpenFit 2 AI提供了更强的降噪处理能力。
在人声部分2-4KHz频段,OpenFit 2 AI为3.8dB,在辅音、咬字和语音识别关键信息方面较为突出,
而在4-8KHz高频细节部分,听感更“亮”,这样有利于大模型更好的听清和理解字词。
而在峰值余量方面录音笔余量更大,在遇到突发大音量声音时不容易爆音。
总体来看,韶音OpenFit 2 AI在实际录音质量方面,人声更靠前,背景噪音处理干净,人声清晰度频段语音细节也更为完整。
录音笔的文件规格更高,并且保留了更多的电平余量,后期拉音量会更稳定,
韶音OpenFit 2 AI在安静环境,单人中距离讲话的场景下很占便宜,但如果是多人激烈讨论、突然提高音量可能会出现压缩感和局部失真。

在转写部分,在现有标准稿范围内,OpenFit 2 AI 的 CER 为 12.61%,专业录音笔为 15.13%。

但从关键信息识别率看,OpenFit 2 AI 错误 2 项,专业录音笔错误 4 项。虽然只是截取了发布会中其中一个段落作为参考样本,但还是有一定的参考价值。
法律和医疗咨询:真正的难题是专业词和多人抢话
第二组的测试难度就开始指数级的提升了,正巧我之前有两段法律和医疗资讯的录音样本文件。
法律资讯部分是包含三个人的真实法律资讯录音,录音中会同时出现普通话、上海话、普通话与上海话方言的切换,以及法律专业词汇,而且其中还有抢话的语境。

从图表中可以看到,韶音OpenFit 2 AI基于千问大模型,在专业术语的命中率上还是挺高的。
这里我需要说一下普通话CER为0%是因为整段沟通中普通话大概只出现了6个字。
最让我惊讶的是在上海话的CER的指标上,毕竟在样本语境中上海话说的非常快,CER还能获得54%,韶音OpenFit 2 AI对方言的识别能力也是挺厉害的了。
另一组是医疗咨询,在一个比较嘈杂的环境下的2人对话,其中涉及比较多的专业医疗术语,而且全程沟通中会出现比较多的环境干扰声音,比如喧叫声、电话铃声和打印机打印出纸的声音。

在嘈杂环境下,录音笔的整体字符错误率更低,为 13.75%;OpenFit 2 AI 为 17.29%。

但从医疗专业术语看,OpenFit 2 AI 的命中率更高,达到 77.8%,高于录音笔的 61.1%。
这说明 CER 只能衡量整体文字差错,不能替代对关键医疗术语的单独检查。对于医疗咨询这类场景,漏掉“室间隔”“心梗三项”这类词,影响会明显高于普通语气词或重复字错误。
从 1 米到 20 米,转写能力会怎么衰减
从之前的测试来看,OpenFit 2 AI会刻意调高录制的综合响度,并且尽可能的消除环境的噪音。
但我也非常好奇,到底OpenFit 2 AI转写CER到多少米才是极限。
所以我选了个相对安静的室内空间,音源音量保持不变,用同一个样本,保持人与设备的朝向。
我准备设置为1米、5米、10米和20米四档距离来录同一个2分钟的文本。

1米作为基准稿件是我人工进行听写的基准稿,实际从图表中可以看到随着距离增加之后,转写的衰减性是很明显的,而到20米的时候CER值在53.78%。
即使在20米的距离下,OpenFit 2 AI还能提取部分讨论主题,但已经无法稳定保留逐字内容,由于距离的原因更像是生成了一个大概的摘要,当然正常情况下在20米距离录音也是很极限了。
翻译不能只看最后一句中文
在之前的现场发布会录音中,OpenFit 2 AI在中英文混合语境中,显然没有抓到关键的英语词汇,
所以我想测试下韶音OpenFit 2 AI分别在英文语境识别结果、科技英语识别结果以及中英混说的识别结果。
第一组为纯英文语境,主要观察原文识别和中文译文是否出现语义反转的情况。
第二组使用科技行业英语,里面会涉及AI、芯片、存储、音频和英文缩写,考验其对上下文的理解力。
第三组模拟我平时可能遇到的科技采访情景,在中文里不断插入inference、HBM、UCIe、AI PC之类的词。
这可能是最接近我实际工作的场景。很多转写系统面对英文表现都很好,但到中文语境里的英文缩写,容易出现听到了单词,但是不理解这个词在这个行业里到底是什么意思。

在纯英文语境下,OpenFit 2 AI 的英文 CER 为 15.55%。它能够保留大部分对话主线,否定句也没有出现明显反转,但存在语义替换。
尤其是将原文中的 “da, da, da” 翻译成“搞定了吗”,说明它可以帮助用户快速理解大意,算是可靠的英文转写与翻译。
在科技英语测试中,OpenFit 2 AI 的英文 CER 为 12.03%,明显优于上一组纯英文语境的 15.55%。
它对 HBM、GPU、data center、power grid、processor 等科技词汇的识别总体稳定,关键术语命中率达到 89.5%。
但 NVIDIA B200 被拆分识别,gaming GPUs 被误识别为 gaming GPS,说明它已经能够处理大部分科技英语内容,却仍可能在具体产品型号和缩写上出现影响事实的错误。
在中英混说的科技采访场景中,OpenFit 2 AI 的 CER 为 17.97%,明显高于纯科技英语测试中的 12.03%。
它能够保留 logo、Manifesto 等常见英文词,但在品牌名、人名和完整专有名词上表现不稳定:Jane 被识别成“简”,Sandisk 的英文名被省略,Susan Park 则没有被识别出来。
这个结果说明,OpenFit 2 AI 在中英混说环境下可以帮助用户理解完整的内容,但用于科技媒体写稿,英文品牌、人名和产品信息还是需要回听确认。
我用了十几年录音笔了,一直留在身边最主要解决的是随时能录制我需要的声音。
数字录音让声音能更好地存储,语音识别则让声音能快速的转成文字。

OpenFit 2 AI的优势非常明显,它本来就是一副可以长期戴在耳朵上地开放式耳机,所以我不需要额外再去寻找录音笔,
当然它也不能代替专业录音笔,尤其在超远距离、多人抢话和高风险专业场景下,关键内容仍然需要回听确认。

当我不需要工作的时候,它就是一副兼顾通勤和运动的开放式耳机,当我开始工作时他也能给我提供可靠且值得信任的转写和翻译能力。
很多时候临时采访根本不会给我准备时间,一副能始终戴在耳朵上的OpenFit 2 AI,它有机会成一副每天戴在耳朵上的信息记录工具,光是少带一个设备就已经非常省心了。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
