9月19日下午,千问大模型官方微博官宣发布同声传译专用大模型Qwen3.8-LiveTranslate(部分媒体写作18日或20日,以官博19日15:32的时间戳为准)。三个官方卖点:字均延迟(LAAL)从上一代的2.8秒压到2.3秒;新增实时说话人分离,每句话能标出是谁说的;支持60种语言。微博上很快出现"2.3秒,AI第一次摸到人类同传译员门槛"的说法,理由是专业译员的"耳口时差"普遍在2-3秒。微博微博微博
这个"门槛论"是博主类比,不是第三方实测。但模型本身值得认真看——如果你是天天开跨国会、做出海直播、给多语种内容做本地化的那批人,这篇把官方数字、竞品对比、接口口径和译员账单一次对完,你按自己的场景入座就行。
一、四个数字是四把尺,别加成一个"总分"
官方评测图给了两组数字,来自不同测试集、量的是完全不同的东西。
FLEURS多语言集(70个语向):xCOMET-XXL翻译质量85.7、LAAL延迟2.3秒、ASR WER转写错误6.6、UTMOS语音自然度4.0。翻译质量、平均等待、转写错误、合成语音听感——四个维度各管各的,谁也不能替代谁。知乎
Omnilingua-MSpeaker多说话人集(14个语向):说话人分离错误率DER为9.7,官图中所列系统最低。对比对象包括Seed LiveInterpret 2.0、GPT-Realtime-Translate、Gemini的实时翻译等,均见官方评测图。知乎
必须保留的证据边界:以上全部是厂商自报口径,完整测试条件、第三方复现、以及与人工同传的可比性尚未披露。写选型报告,引用时要标"官方数据",不能写成"实测成绩"。
二、快的这0.5秒,原理是"听过的话不用重新听"
LAAL是平均值:把整段发言摊开,译文平均晚到多久。它不告诉你最慢那句等了多久——稳定的2.3秒,和忽快忽慢但平均2.3秒,耳朵里是两种体验。
3.8提延迟靠的是Interleave架构:基于Hybrid MoE的Thinker-Talker双模块,把音频和文本交织进同一条流,已经听过的音频和已经吐出的译文可以缓存复用,不必每攒完一句就从头组织输出。官方口径是质量与延迟同时改善,平均等待缩短约18%。 这里的数据仍是厂商评测口径,完整测试条件、第三方复现以及与人工同传的可比性尚未披露。微博知乎

0.5秒放进单句里很短,放进两小时的连番会议里是"译文一直落后现场一整页"的持续错位。这次能压多少,取决于你的真实网络、真实语向和真实插话密度,发布会样片不算数。
三、"认人"才是这代的主菜,也是最大的边界
三人圆桌最能暴露旧同传的短板:话筒换了三次,译文把三个人混成一个无名声源;同一个术语过两分钟换一种译法。这代三件套各解一个问题:实时说话人分离管归属(还能用对应发言人的音色念译文),原文译文同帧同出管时间对齐,长上下文消歧管术语和指代前后一致。但注意DER 9.7本身就是错误率:按厂商测试集口径,仍有约每十处归属错一处量级的问题。而且官方没有承诺多人抢话、叠话、极短插话下不错标。微博

验收的时候,把你们最近一次会最乱的那段录音喂进去——三人抢话段、专有名词轰炸段、"就像他刚才说的"回指段——这三段过了才有资格谈替换。
四、60和29是两个数:能看的语言比能听的多31种
输入音频和输出文本覆盖60种语言,输出音频只有29种。剩下31种能出字幕、出不了译音。做小语种内容本地化的团队,产品路线要拆成两件事:字幕层可以先把60种铺开,语音层按29种逐个核对,别在上线周才发现某些市场"只会打字不会说话"。知乎
语种口径还有历史包袱:2025年9月的一代只支持18种输入、10种输出,今年5月的3.5代扩到60种输入、LAAL 2.8秒。三代都在扩,但"60种"这个数的准确含义每一代都要重新读。知乎
五、接入前三个坑,接的是API的人先抄下来

第一,通道只有一条:模型名qwen3.8-livetranslate-flash-realtime,当前仅阿里云百炼提供推理,走WebSocket Realtime API接入。上线速度、区域可用性、数据合规,你都只有一个对手方谈。截至19日,百炼模型页已列出北京与新加坡区域的token单价及RPM/TPM限流——单价会调、区域有差,报价以部署当日页面为准,别拿任何文章(包括这篇)当询价依据。知乎
第二,版本不能串用:3.8用session.output_modalities配置输出模态,和3.5的AOQ/WebRTC、VAD/Manual断句、音色参数存在差异,照搬老代码接不上。Qwen3.8-Omni、Max、Flash是同代不同能力的产品,全双工对话、工具调用这些不能顺手算到LiveTranslate头上。
第三,一个可以省钱的正经细节:3.8的ASR常开、免费、关不掉。如果你的链路旁边还挂着一路独立ASR做原文对齐,这层接口可以直接退役——原文转写、译文、译音、结束信号在同一份日志里对得齐,最小链路才算跑通。知乎
六、和人工译员的账,怎么对才对
翻译公司2026年的市场报价单:英语同传译员6000-8000元/人/天。常规同传会议按两名译员轮换核算,一天就是1.2-1.6万元。财经类语向的市场报价则在12000-16000元一档。AI侧成本=部署当日token单价×会议时长×并发数,再省掉一路ASR。账面上看是数量级碾压,但人工译员卖的不止是"2-3秒耳口时差":临场救场、术语责任、错译可追责,这些没有进任何一列成本。知乎知乎知乎
按场景拆,别一刀切:
内部跨国会议、课程直播字幕、出海客服参考:可以立刻拉进验证清单,用最乱的真实录音测分离和术语一致性。
小语种内容本地化:字幕先上,29种语音输出按市场逐个验收。
对外谈判、财报会、法律留痕:先别撤人。官方自己都没承诺不错标,这类场景里"译文对错人"是责任事故,不是体验问题——最多做人工同传的辅助轨。
七、接下来盯什么
三个信号值得跟进:一是第三方在FLEURS/Omnilingua口径下的复现数字,2.3秒和9.7稳不稳,复现出来才算数;二是输出音频语种会不会从29往上扩,这是小语种团队从"能看"到"能听"的发令枪;三是端侧跟进速度——理想AI眼镜LIVIS本月20日刚OTA推送多语种同传。同传正在从"接API的工程题"变成"戴在脸上开箱即用"。你今晚决定接不接百炼这条WebSocket,赌的就是这两周里的调用账单和竞品的下一版价格。知乎