智谱发布了开源的GLM-OCR模型,以0.9B参数的轻量化设计实现了94.6分的高精度文档解析,在主流基准测试中表现卓越,为文档数字化处理提供了新的解决方案。
智能速览
GLM-OCR以94.6分登顶OmniDocBench V1.5基准测试
仅0.9B参数规模,支持多种部署方式
在手写体、复杂表格等高难度场景表现稳健
完全开源,提供完整SDK与推理工具链
支持一行命令快速调用,便于业务系统集成
精华内容
智谱GLM-OCR的发布标志着文档解析技术的新突破,其小尺寸高精度的特性为行业带来了新的可能。
性能表现
GLM-OCR在OmniDocBench V1.5基准测试中以94.6分的高分位居榜首,展现出卓越的文档解析能力。在公式识别、表格识别、信息抽取等多个主流基准测试中均取得SOTA表现,特别是在OCRBench(Text)测试中达到96.9分,UniMERNet达到96.5分,远超同类模型。
场景优化
针对真实业务痛点,GLM-OCR在手写体识别、复杂表格解析、代码文档处理及印章识别等高难度场景中表现稳定可靠。模型能够准确处理日常工作中常见的各种文档类型,满足不同行业的文档数字化需求。
推理效率
凭借仅0.9B的参数规模,GLM-OCR实现了高效的推理性能。模型支持vLLM、SGLang和Ollama等多种部署方式,显著降低推理延迟与算力开销,特别适合高并发场景和边缘设备部署,为企业节省硬件成本。
开源生态
GLM-OCR完全开源,同步提供了完整的SDK与推理工具链。开发者可以轻松部署和使用,环境依赖简单,支持一行命令快速调用,能够无缝接入现有业务系统,大大降低了技术门槛和使用成本。
关键评论
精准的OCR识别能力获得用户认可
在文档处理领域树立了新的技术标杆