面对号称“天书”的医生手写处方,主流AI大模型的视觉能力究竟如何?本文通过极具挑战性的实测,横向对比了多个热门AI模型,直接揭晓哪款模型的“视力”最靠谱,为技术应用提供直观参考。
智能速览
采用医生手写处方进行AI视觉能力实测。
PaddleOCR-VL、百度搜索、豆包等模型均识别失败。
阿里通义Qwen3-VL模型成功识别了处方内容。
通义Qwen3-VL模型表现最靠谱,且开源可商用。
精华内容
理论分数高不代表实战能力强,一场针对“天书”处方的终极考验,将各大AI模型的视觉实力暴露无遗。
严苛的考题
为检验AI大模型的真实视觉能力,测试选择了一张极具挑战性的图片:医院医生手写的处方。这种字迹潦草、个人风格极强的文本,被普遍视为OCR识别领域的“天书”,足以考验出模型在极限场景下的识别精度和鲁棒性。
多数模型落败
在这场考验中,多数模型表现不佳。百度飞桨PaddleOCR-VL和百度搜索功能在识别时出现了幻觉,输出了错误内容。豆包和Kimi2大模型则因字迹过于潦草而直接放弃识别,仅给出指导意见。文心一言同样未能成功读取处方内容。
唯一胜出者
在所有参与测试的模型中,阿里的通义Qwen3-VL成为了唯一的胜出者。它不仅成功识别了图片,还谦虚且准确地读取出了处方中的文字内容,表现出极高的可靠性。更关键的是,该模型为开源模型,支持本地化部署与商用,为开发者提供了极大的灵活性。
在极限场景下,阿里通义Qwen3-VL展现了领先的视觉识别能力,成为可靠选择。AI的“视力”虽有长足进步,但面对复杂现实挑战,仍需审慎选择。未来,谁能在更多极限场景中胜出?