面对竖排繁体、扫描模糊、夹杂方言的古籍图片,三款主流AI模型展现出显著差异。测试覆盖文本识别准确率、出处溯源能力、方言解析深度与事实守真度,结果指向一个关键判断:检索增强能力与语料覆盖广度,比单纯OCR精度更能决定古籍理解成败。
智能速览
豆包在《笑林广记》识别中率先纠错,通过RAG精准定位原文并修正OCR错误
元宝虽识别出《斩鬼传》,但虚构书名《术业》,存在事实性杜撰风险
千问能正确溯源《笑林广记》,但翻译错译主语关系,且完全未识别《斩鬼传》
面对吴方言密集的《何典》,豆包提供系统性方言词表与语境释义,元宝解释较笼统
三者均未将‘讼之于官’误译为法律动作,但千问错译为‘去官府告我’,混淆施事主体
精华内容
古籍不是OCR题,而是语义解码题——模型能否把模糊字形、陌生句式、地域用语还原为可理解的逻辑链,才是真实文化理解力的试金石。
OCR不是终点
同一张《笑林广记》扫描图,豆包初始OCR输出为‘讼之子’‘敢却。用药’,错误率达37%;元宝跳过OCR直接生成白话文,但虚构书名《术业》;千问OCR错误相似,却未杜撰出处。实测表明:OCR准确率仅是基础门槛,真正分水岭在于能否调用外部知识库进行交叉验证与语义校准。豆包在被告知‘有误’后,5秒内完成RAG检索并返回标准文本,证明其检索链路稳定可靠。
溯源能力即文化可信度
《斩鬼传》测试中,豆包与元宝均在首图即识别出书名及章节位置,准确率100%;千问全程未命中任何有效出处,输出内容与原图无实质关联。进一步对比发现,豆包不仅标注‘出自清初刘璋《斩鬼传》卷一’,还指出‘此段描写钟馗夜巡遇饿鬼’;元宝仅给出‘鬼怪故事节选’泛化描述。这说明:准确溯源不仅是关键词匹配,更需建立文本-作者-时代-体裁的多维映射。
方言解析见真功
《何典》测试聚焦吴方言识别。豆包列出‘放屁’(意为‘胡说’)、‘鏖糟’(意为‘肮脏’)、‘活狲’(意为‘顽童’)等12个词,逐条标注方言区、本字考据及现代对应义;元宝仅解释‘鏖糟’‘活狲’两词,未提音韵特征或文献佐证。当要求分析‘天书般难懂’的‘廿四桥明月夜’一句时,豆包指出该句实为扬州典故误植,与吴语无关,属文本混入错误——这种元认知能力,远超简单释义层面。
这场测试不单是工具比拼,更是对AI文化基础设施成熟度的一次检验。豆包在事实守真与深度解析上表现最均衡,元宝长于快速响应却偶陷虚构,千问则暴露冷门文献覆盖短板。当古籍数字化进入深水区,用户真正需要的,不是更‘聪明’的幻觉生成器,而是更‘老实’的知识协作者——它该知道哪里懂,更该清楚哪里不懂。下一个问题或许是:如何让模型坦然说出‘这段吴语,我尚未训练充分’?