张大妈

智谱开源GLM-OCR模型:仅0.9B参数,多项基准取得SOTA表现

源自今日头条:IT之家

02-04 10:46

智谱开源的 GLM-OCR 模型,以仅 0.9B 的参数量,在多项文档解析基准测试中取得了顶尖性能。它不仅解决了传统 OCR 在手写体、复杂表格等场景下的识别难题,还通过极致的压缩与优化,显著降低了部署与使用成本,为高并发和边缘计算场景提供了新的可能。

智谱开源GLM-OCR模型:仅0.9B参数,多项基准取得SOTA表现智能速览

  • GLM-OCR 仅 0.9B 参数,性能在多项基准上达到 SOTA。

  • 模型在手写体、复杂表格、印章等高难度场景中表现稳健。

  • 支持批量处理与 RAG,输出可直接用于网页或数据分析。

  • API 价格仅为 0.2 元/百万 Tokens,成本约为传统方案 1/10。

  • 采用自研 CogViT 视觉编码器与两阶段技术范式。

智谱开源GLM-OCR模型:仅0.9B参数,多项基准取得SOTA表现精华内容

这款小尺寸模型的高性能并非偶然,其背后是技术创新与场景优化的深度融合,值得深入探究。

性能表现

GLM-OCR 的核心优势在于其“小尺寸,高精度”的特性。在权威的 OmniDocBench V1.5 文档解析榜单中,该模型以 94.6 分的成绩登顶。在文本识别、公式识别、表格识别和信息抽取四大细分任务上,其表现均优于多款 OCR 专项模型,性能接近规模远大于它的 Gemini-3-Pro,展现了卓越的泛化能力。

场景优化

针对真实业务痛点,GLM-OCR 进行了深度优化。它能精准识别扫描件中的手写体、印章、竖排及多语言混排文本,在复杂版式下保持高准确率。对于合并单元格、多层表头的复杂表格,模型能直接输出结构化的 HTML 代码,无需二次制表。同时,它还能从卡证票据中提取关键字段并输出标准 JSON 格式,无缝对接企业系统。

推理成本

得益于 0.9B 的小参数量设计,GLM-OCR 的推理效率极高。在同等硬件条件下,其处理 PDF 文档的吞吐量可达 1.86 页/秒,图片处理达 0.67 张/秒,速度显著优于同类模型。成本方面,其 API 价格仅为 0.2 元/百万 Tokens,换算下来 1 元即可处理约 2000 张 A4 扫描图或 200 份 10 页的 PDF,成本约为传统 OCR 方案的十分之一,极具商业吸引力。

GLM-OCR 通过开源,将高精度文档识别能力以极低的门槛释放出来,为行业应用提供了强大且经济的工具。随着未来更多尺寸和语言版本的推出,它在视觉智能领域的应用边界将进一步拓宽。这是否会开启一个高效、低成本文档处理的新时代?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章