翻到第87页,"供应商"变成了"厂商":AI译长文档最贵的坑不是错译,是"失忆"

源自148位全网作者

08-30 13:53

一个帮跨境电商做产品文档本地化的从业者,8月初分享过一件头疼事:200页的产品手册,AI开头把 supplier 翻成"供应商",到第87页变成"厂商",第154页又成了"供货方"——每一句单看都没错,整篇读起来却是乱的。知乎同一个月里,知乎上前后冒出一串针对这个现象的实测和复盘:5款PDF翻译工具跨100页的"长记忆"比拼、《为什么100页PDF翻译到后半段质量断崖式下降》、《术语不一致导致的连锁返工》。知乎圈子里给这类问题起了名字:术语漂移。

如果你接过技术文档的翻译单,或者正在用AI自己啃一份百页手册,这事值得单独拎出来讲清楚:它到底是什么、为什么比"翻错一个词"贵得多、以及交付前怎么堵住。

不是模型笨,是分块让它"忘了自己"

面对术语漂移,第一反应通常是"AI果然不靠谱"。但一线从业者的复盘指向一个更准确的地方:这多半不是模型能力问题,是流程问题。一份百页文档,几乎没有翻译工具会整篇吞下,而是切成十几个chunk逐块独立翻译——省钱、提速,而且PDF还要先抽版面文本。

问题出在:每个片段被翻译时,通常看不到其他片段是怎么翻的。知乎模型只能对同一个词现场"重新决定":customer acquisition cost,第1个chunk译"客户获取成本",第5个chunk可能就变成"获客成本"或者"顾客取得费用",每一处都是局部最优,整篇文档却没人认账。知乎这是逐段翻译模式的结构性盲区:短文档可能碰巧全篇一致,长文档几乎必然漂移。

有博主自测过一个量级感受(单一博主自测,仅供参考):同一款主流工具翻80页报告,前10页术语一致性98%,后30页掉到71%。知乎漂的不只是术语——原文里"上文所述方法""如表3.5所示"这类指代和交叉引用,一旦被分块切到两个chunk里,模型同样只能猜,编号体系前后错位就是这么来的。

术语漂移为什么比错译贵

错译是一处的事,改了就完。术语是"连锁"资产:改一处,全文二十几处引用都得跟着改,连带的截图、代码注释、错误码表也要重新对齐。知乎做过技术文档本地化的人给过一条被反复转引的经验:一篇译文语言层面的错误可能只有三四处,术语不统一导致的返工却能多达十几处。验收方的感受更直接——不少企业客户就是安排人逐段验收的,挑出来的毛病不是"这句翻错了",而是"看起来不专业",然后整包打回。知乎越是合同、药品说明书、技术图纸这类文档,术语本身承担着精确指代的功能,译法不统一就不是"读着别扭",而是指代功能失效——已经算实质性错误。知乎

反直觉的一笔:一致≠统一

意识到问题之后,最容易犯的错是走向另一个极端:全文一刀切统一。不少译员反对这个做法——多义词不该硬统一。同一个 container,Docker语境译"容器",UI语境可以是"容器组件",好的术语库会给同一个原文留多条映射,各自标注适用场景。知乎读者对象也会改变规则:面向开发者的文档,“API”“SDK"这类缩写往往保留英文原样,混写反而高效;面向终端用户的操作手册才需要本地化全称——让读者先构建一张术语对照表才能读懂的文档,本身就是失职。做小语种技术文献的译者还有个朴素教训:俄语的 пластовое давление,查字典是"层状压力”,但业内都叫"地层压力",照字面直译反而是外行。知乎所以真正要防的不是"词长得不一样",而是"同一个指代,说法摇摆"。规则要写进术语库,而不是留给模型每次自由发挥。

三步堵住它,不同人群停在不同的深度

第一步,翻之前:先提术语,再动手。让模型先通读全文,输出"术语+候选译法"清单,人工拍板定稿。只收两类词:高频的、易歧义的,优先收录反复出现且容易产生歧义的专有名词,别追求大而全。知乎一份能用的术语表,最小字段集就五个:源术语/标准译法/禁用译法/适用场景/确认人。游戏本地化从业者分享过治理万条级术语库的土办法:去重——一个词出现多次只保留一条,再过滤掉单字词和纯数字,然后按首字母分组、长词优先匹配,本质都是让AI像人一样"查对词条",而不是翻错行。小红书

第二步,翻的时候:把术语表强制注入。每个翻译任务的上下文里附上定稿术语表,命中词条按表译,不让模型自由发挥。字幕组社区有人把开源工具拆成"粗翻→术语统一→精校"三段流程,就是这个机制的原型。微博工具支持自定义术语库(CSV/Excel导入)的,直接导入,别只靠prompt里提一嘴。分块按章节切比按页码切效果好,因为章节内部上下文连续性更强;综述、结论这类交叉引用密集的段落干脆别分块,单独放全文上下文里一次翻完。知乎

第三步,交付之前:跑一遍一致性扫描。用脚本或让模型统计,同一英文术语在译文里是否被翻译成了不同的中文词,不一致项先盘点、统一、再写回库锁定。知乎顺序不能反:对历史文档,先建库、再批量修正、最后锁定,不建库就想逐篇修,是返工黑洞。知乎

三类人停在不同深度:

  • 个人译员/每月几十页的量:第一步+第三步就够,一份Excel术语表加prompt注入,边际成本最低;

  • 长期维护同一产品线的团队:必须加术语审批流程——没有审批,人人往库里"补"自己的译法,术语表本身就会变成不一致的源头;到这一步,CAT工具(Trados、memoQ一类)的术语库模块或术语API才是解法。知乎

  • 多语言出海企业:术语库至少覆盖源语言和目标语言的双向对照,一张主表管所有语言,别逐语言建表各自漂移。

选工具层面,社区给的建议很实在:别信营销页上的"准确率99%",拿自己的真实长文档测一轮跨页术语一致性,比任何评测排名都靠谱。知乎术语提取、全局术语索引这些原本属于CAT工具的能力,正在变成通用AI翻译工具的标配,值得放进你下一轮选型清单里。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章