一款仅0.9B参数的开源OCR模型,在OmniDocBench榜单取得94.62分SOTA成绩,实测手写公式识别准确率提升23%,支持边缘部署与零代码调用,重新定义轻量级模型的性能边界。
智能速览
在OmniDocBench V1.5榜单获94.62分,刷新SOTA纪录
对手写公式、带红章票据、复杂表格等难场景识别准确率比传统工具高23%
支持API调用、Docker本地部署、SDK一键解析三种落地方式
PDF处理吞吐量达1.86页/秒,图片处理0.67张/秒,速度接近同类模型2倍
采用版面分析→并行识别两阶段流程,可输出HTML表格与标准JSON字段
模型权重与完整工具链开源,代码Apache 2.0、模型MIT协议,商用无限制
精华内容
当行业还在追逐更大参数时,GLM-OCR用精巧架构证明:小模型也能在真实文档场景中全面胜出。
参数精简,能力越级
GLM-OCR虽仅0.9B参数,但在文本识别、公式解析、表格提取、信息抽取四大任务上全面超越多款专项OCR模型。其视觉端采用CogViT编码器,在数十亿图文数据上预训练,能精准捕捉手写连笔、红色印章、代码符号等细微特征;跨模态连接层通过4倍下采样高效传递关键信息;配合独创Multi-Token Prediction(MTP)损失策略,训练效率显著提升。内部测评显示,面对带合并单元格的财务报表、竖排古籍扫描件、中英混排外贸合同,识别准确率稳定高于主流工具23%以上。
开箱即用,三类部署
开发者无需GPU即可通过智谱MaaS API调用,填入config.yaml配置后即时生效;本地部署支持vLLM、SGLang、Ollama三种主流推理框架,Docker镜像拉取后3分钟启动服务;非技术人员可直接使用SDK命令行工具,一行指令解析整个图片文件夹,自动输出JSON或Markdown格式结果。在普通服务器(CPU+单卡T4)环境下,PDF文档处理吞吐量达1.86页/秒,图像处理速度0.67张/秒,较同级别模型快92%。银行票据审核场景实测表明,相同并发请求下算力成本降低70%,服务响应延迟低于120ms。
不止识字,更懂结构
GLM-OCR采用PP-DocLayout-V3版面分析模块先行拆解文档逻辑结构,再对标题、正文、表格、公式等区域并行识别。处理含跨行跨列的Excel式表格时,不仅能准确识别每个单元格内容,还可自动生成语义正确的HTML代码,直接用于前端渲染或数据清洗;解析身份证、银行卡等证件时,自动定位姓名、卡号、有效期等关键字段,输出符合ISO/IEC 18013标准的JSON Schema;对日文竖排合同、阿拉伯语混排发票等多语言文档,字符级识别F1值达91.3%,较通用OCR模型提升16.8个百分点。
GLM-OCR不是参数竞赛的旁观者,而是以工程化思维重构OCR价值链条的实践者。它把高精度、强泛化、易集成、低门槛真正统一于一个轻量模型之中。随着多语言版本和视频帧OCR功能的推进,文档智能的落地边界正在持续拓宽——下一个需要被‘读懂’的,会是哪一类非结构化内容?