张大妈

告别算力虚胖:智谱GLM-OCR用0.9B参数诠释文档解析的暴力美学

源自今日头条:墨风如雪

02-05 14:08

传统OCR面对复杂文档时力不从心,而通用大模型又成本高昂。智谱AI推出的GLM-OCR模型,仅以0.9B参数,在文档解析精度和速度上实现了突破,为处理各类“排版噩梦”提供了高性价比的新解法。

告别算力虚胖:智谱GLM-OCR用0.9B参数诠释文档解析的暴力美学智能速览

  • GLM-OCR模型仅0.9B参数,体积约2.65GB,部署极为轻便。

  • 在权威榜单OmniDocBench V1.5上得分94.6,性能超越谷歌Gemini-3-Pro。

  • 实测PDF处理速度达每秒1.86页,吞吐量较同类竞品提升近50%。

  • 能精准识别复杂表格、手写体及多栏混排,直接输出结构化格式。

  • API调用成本仅为0.2元/百万Tokens,极大降低了使用门槛。

告别算力虚胖:智谱GLM-OCR用0.9B参数诠释文档解析的暴力美学精华内容

这款模型的独特之处,在于它如何以极致轻量的设计,实现了碾压性的性能与实用性。

极致轻量,拒绝臃肿

在千亿参数模型为主流的时代,GLM-OCR反其道而行,将模型压缩至0.9B(90亿)参数,体积仅约2.65GB。这意味着它无需昂贵的硬件集群,甚至在边缘设备上也能高效运行。

其性能并未因体积而妥协。智谱通过自研的CogViT视觉编码器与GLM-0.5B解码器架构,将算力集中用于视觉理解。数据显示,它在单副本单并发场景下,处理PDF的速度达到每秒1.86页,图片处理为每秒0.67张,吞吐量相比同类方案提升近50%。

专治复杂排版

传统OCR的痛点在于对“结构”的无能为力,面对复杂表格、公式、中英文混排及手写体时,只能输出混乱的字符流。GLM-OCR的核心优势在于理解文档结构。

它能直接将复杂表格还原为标准的HTML或Markdown代码,无论是合并单元格还是多层表头,都能处理,省去了二次开发的繁琐。针对手写体、印章遮挡等高难场景,通过强化学习训练,能从票据卡证中精准提取字段并输出为JSON格式,为金融、物流等行业的自动化流程提供了技术支持。

成本革命与开放部署

技术的价值最终要体现在应用成本上。GLM-OCR采取了激进的定价策略,API调用成本仅为0.2元/百万Tokens。这个价格意味着,大约1元钱即可处理2000张A4扫描图或200份10页的PDF,成本降至传统OCR方案的十分之一。

同时,它对部署环境极为友好,不仅支持vLLM、SGLang、Ollama等主流推理框架,还完成了对国产沐曦GPU的Day 0适配,为用户提供了云端调用与私有化部署的灵活选择。

GLM-OCR的出现证明了专注与效率在AI领域的价值,为文档解析提供了一个兼顾性能与成本的实用方案。其开源精神或将推动更多垂直领域的轻量化创新,让AI技术真正落地到具体场景中。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章