AI会议纪要最坑人的三个字是“发言人2”:多人会议分不清谁说的,不是工具听不清

源自6位全网作者

07:42

开完会最让人崩溃的瞬间,不是没纪要,而是打开AI纪要,看见满屏的"发言人1""发言人2"“发言人3”。

那句"预算要再确认"明明是老板说的,纪要里却记在了"发言人3"头上;同事明明全程只开口了一次,屏幕上却出现两个不同的发言人。最近小红书上一条求推荐会议录音软件的帖子拿到几百赞,楼主列的功能需求里有一句格外真实:“能区分不同人声最好了”。小红书很多人的第一反应是:这工具转写不准。其实冤枉它了。今天想跟你聊明白一件事:多人会议分不清"谁说的",大多数情况下不是工具没听清,而是一个到今天都没被完全解决的问题。

“说了什么"和"谁说的”,根本是两套系统

先澄清一个常见误解:绝大多数AI纪要工具里,转文字和认人,是两个模块在干活。

语音识别(ASR)只管把声音变成文字;而每段话前面的"发言人1"“发言人2”,来自另一项叫"说话人分离"的技术:系统先把录音切成一个个小片段,从每个片段里提取声音特征(可以理解为"声纹指纹"),再做聚类,把特征相似的片段归到同一个发言人名下。

也就是说,一份多人会议的逐字稿,其实是两套结果拼起来的:一套是"说了什么",一套是"谁说的"。任何一环出错,最终稿都会乱——文字可能全对,归属却全错。知乎

那归属为什么会错?最近技术圈专门有人把这事拆开讲过,归纳下来,经常栽在这五个地方:

1)一个人被拆成两个人。有人说话时转头、后仰、走到会议室另一侧,离麦克风的距离和角度变了,录到的声音特征跟着变,系统以为"来了个新人",把一个人拆成两个编号。

2)两个人被合成一个人。两位参会者音色接近、说话节奏相似,或者录音质量本身较差,系统可能把俩人归到同一个名下。

3)短句天生吃亏。全程只说"可以"“没问题”"我补充一下"的人,能提供声音信息太少,判断容易飘,一会儿被归给发言人A,一会儿归给B。

4)最麻烦的是抢话。两个人同时开口,麦克风收到的是混合信号,系统通常只有四种结局:只保留声音大的那个;把两个人的声音当成一个"新发言人";文字转出来了但分不清归属;或者干脆认定这段质量差,直接丢弃。会议里讨论最激烈的部分,恰恰是纪要失真最严重的部分。知乎

5)声纹自动对名字,也不稳。有的工具支持提前录入声纹、自动匹配姓名,但注册时手机近场录音、开会时会议室远场收音,信道差别很大,感冒、嗓子哑也会影响匹配。阈值调低了,声音像的人被认错;调高了,录过的人也经常匹配不上。

AI会议纪要最坑人的三个字是“发言人2”:多人会议分不清谁说的,不是工具听不清

比较稳妥的做法,也是现在多数工具的实际形态:先给你"发言人1/发言人2"的编号,再由人工把编号对应到具体人名。

最强的模型今天能到什么程度?答案可能让你失望

今年夏天,这个领域确实有实打实的进展。

8月中旬,复旦OpenMOSS团队的MOSS-Transcribe-Diarize技术报告在技术圈被讨论。它的思路和传统做法很不一样:不再走"先切片、再转写、再聚类、再对齐"的流水线,而是把整段音频一次性喂进去,模型直接输出"谁在什么时间说了什么",最长能一口气处理90分钟的会议。

AI会议纪要最坑人的三个字是“发言人2”:多人会议分不清谁说的,不是工具听不清

成绩确实能打:按报告的说法,它在多个多人会议、长访谈公开基准上超过了GPT-4o、Gemini 2.5 Pro等商业系统。知乎

但更值得你记住的是另一个数字:这个级别的模型,在多人会议基准AISHELL-4上的字符错误率仍有14.84%,算上说话人归属错误还会更高。知乎也就是说,今天公认最强的开源模型,放到多人会议场景,大约每六七个字就有一处需要人工过一遍。你每天用的那些商业产品,到了复杂多人场景,本质上同样离不开人工核对。

这不是哪家产品不努力。技术分析里有句话说得很实在:在会议现场,人能靠语气、座位、上下文判断是谁在说话,算法只能靠那一条音轨。知乎所以"全自动认人"这个期待,暂时可以放下了——目前没有产品配得上这样的宣传语。

好消息是,开源这边追得很快。除了MOSS,OddASR、Meetily、Hyprnote这类本地开源工具今年接连更新,说话人分离、热词纠正、本地部署都成了标配,录音和转写可以留在自己电脑里——对涉密会议来说,这条路值得单独关注。知乎

AI会议纪要最坑人的三个字是“发言人2”:多人会议分不清谁说的,不是工具听不清

换工具还是买硬件?先问自己四个问题

那到底该怎么办?先别急着下单录音卡,也别急着换工具,问自己四个问题:

第一问:是只会拆成A/B/C,还是能辅助你标到人名?拆开只是第一步,真正费时间的是把A/B/C对应到具体的人。比如开源工具Hyprnote的转写面板,每段话直接按发言人名字标注,这就是"能辅助标人名"的样子。如果一个工具只能拆、不能在命名上帮你省力气,纪要可读性会好一点,但你的会后整理成本未必真的降。

AI会议纪要最坑人的三个字是“发言人2”:多人会议分不清谁说的,不是工具听不清

第二问:同一批人下次再开会,要不要从头再标一遍?这是"能用"和"好用"的分水岭。有的方案支持跨会议复用声纹,第二场会就明显省力;有的每场会都从零开始,再强的分离能力也会被周会磨没。

第三问:标错了之后,纠错顺手吗?现实的工具都应该允许合并、拆分发言人,而不是让你对着一屏"发言人7"干瞪眼。

第四问:插话多的场景表现如何?别只读官网介绍,拿两类会实测:一类是固定几个人反复开的内部例会,一类是插话多、角色复杂的外部会议。看第一次标注花多久、第二次是否明显省、吵的场景里能不能回到某个发言人的原话。知乎

如果你的会议以线上会为主,优先考虑生态:飞书妙记的会议自动生成、声纹识别等核心功能都需要在飞书生态内使用,对已经在用飞书的公司来说,它是绕路最少的选择。知乎钉钉、腾讯会议也各有平台内原生方案。在自己公司已经用的生态里选,远比跟风买独立硬件靠谱。

五个习惯,把"认人"难度降在源头

工具能力有限,但你有办法把输入做得更好。这几条的本质都一样:给算法喂更好的信号。

  1. 录音设备放得离主说话人近一些,或者放在会议桌中间。距离和朝向的变化,是一个人会被拆成两个的最大原因。

  2. 工具支持指定说话人数量时,提前报数。给算法一个明确的分组数,比让它自己猜要稳。

  3. 会议开头花30秒让大家自报家门,或主持人在分工时点名。这等于给系统现场喂了一份"声纹答案",后面纠错效率翻倍。

  4. 散会后趁记忆还热,花3分钟完成命名。把发言人编号逐一对应到人,别拖到第二天翻录音。

  5. 重要决议别只信归属,回逐字稿核一遍原话。尤其是"谁负责、什么时候完成"这类承诺句。

最后,说回预期

说话人分离这条线正在肉眼可见地爬坡:端到端模型开始解决长会议里的"身份漂移",开源在把成本打下来,硬件阵列麦克风在改善信号源头。但此时此刻,对它的合理预期仍然是"辅助+复核"——让工具干分段、初标的重活,把"谁说了什么"的最终确认留给自己。

下次再看到满屏的"发言人2",不用骂转写不准,也不用怀疑自己的耳朵。你现在知道了:那是这项技术现阶段的成长期。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章