智谱开源的 GLM-OCR 模型,以仅 0.9B 的参数量,在多项文档解析基准测试中取得了顶尖性能。它不仅解决了传统 OCR 在手写体、复杂表格等场景下的识别难题,还通过极致的压缩与优化,显著降低了部署与使用成本,为高并发和边缘计算场景提供了新的可能。
智能速览
GLM-OCR 仅 0.9B 参数,性能在多项基准上达到 SOTA。
模型在手写体、复杂表格、印章等高难度场景中表现稳健。
支持批量处理与 RAG,输出可直接用于网页或数据分析。
API 价格仅为 0.2 元/百万 Tokens,成本约为传统方案 1/10。
采用自研 CogViT 视觉编码器与两阶段技术范式。
精华内容
这款小尺寸模型的高性能并非偶然,其背后是技术创新与场景优化的深度融合,值得深入探究。
性能表现
GLM-OCR 的核心优势在于其“小尺寸,高精度”的特性。在权威的 OmniDocBench V1.5 文档解析榜单中,该模型以 94.6 分的成绩登顶。在文本识别、公式识别、表格识别和信息抽取四大细分任务上,其表现均优于多款 OCR 专项模型,性能接近规模远大于它的 Gemini-3-Pro,展现了卓越的泛化能力。
场景优化
针对真实业务痛点,GLM-OCR 进行了深度优化。它能精准识别扫描件中的手写体、印章、竖排及多语言混排文本,在复杂版式下保持高准确率。对于合并单元格、多层表头的复杂表格,模型能直接输出结构化的 HTML 代码,无需二次制表。同时,它还能从卡证票据中提取关键字段并输出标准 JSON 格式,无缝对接企业系统。
推理成本
得益于 0.9B 的小参数量设计,GLM-OCR 的推理效率极高。在同等硬件条件下,其处理 PDF 文档的吞吐量可达 1.86 页/秒,图片处理达 0.67 张/秒,速度显著优于同类模型。成本方面,其 API 价格仅为 0.2 元/百万 Tokens,换算下来 1 元即可处理约 2000 张 A4 扫描图或 200 份 10 页的 PDF,成本约为传统 OCR 方案的十分之一,极具商业吸引力。
GLM-OCR 通过开源,将高精度文档识别能力以极低的门槛释放出来,为行业应用提供了强大且经济的工具。随着未来更多尺寸和语言版本的推出,它在视觉智能领域的应用边界将进一步拓宽。这是否会开启一个高效、低成本文档处理的新时代?