612 次图表重建实验告诉我们的:OCR、图形与连接线

2026-09-04 09:30:15 0点赞 0收藏 0评论

把图表图片转换成可编辑对象,听起来只需调用一次视觉模型:让它输出方框、文字和箭头,再生成文件。这个原型在干净流程图上可行,一旦遇到真实架构图中的小字、重复图标、嵌套容器、并行线路和拥挤走线,就会暴露问题。

为了找到 LayerBack 图片转可编辑图表流程中的质量损失点,我们做了一组受控实验:336 次结构识别,加 276 次拓扑识别,总计 612 次模型运行,覆盖 12 张图。其中 10 张生成图有精确标准答案,另有 2 张真实图。

目标并不是宣布一个通用“最佳模型”,而是回答几个具体工程问题:

  • OCR 清单能否减少节点遗漏?

  • 提高推理强度会不会改善结构抽取?

  • 哪种模型更适合观察连接拓扑?

  • 是否需要第二个模型裁决候选线路?

  • 对于没有线路的图,能否安全跳过拓扑阶段?

被拆开的处理流程

基线流程分为:

  1. OCR 提取文字与坐标;

  2. 多模态模型识别节点、类型、位置和样式;

  3. 确定性代码把 OCR 文字合并到结构中;

  4. 拓扑观察器根据已知节点目录追踪连接线;

  5. 可选的裁决模型接受或拒绝候选边;

  6. 分割模型提取图标与自定义插画;

  7. 确定性序列化生成 draw.io、VSDX、PPTX、SVG 和预览。

拆开后,文字遗漏与虚构连接线成为两个可独立衡量的问题,不需要不断加长同一个提示词来同时修补。

结论一:OCR 不是兜底,而是 grounding

最强的识别配置把明确的 OCR 清单交给视觉模型。terra-low-ocr 在 33 次测量中,节点召回率平均值和最小值都是 1.00 / 1.00。快速配置 luna-low 平均为 0.93,但在困难案例中最低只有 0.32

重点不在模型名称,而是可见文字能成为检查清单。模型即使理解了整张图,也可能省略一个小型数据库标签,或者一排重复卡片中的某一项。提供 OCR 文本与坐标后,每段可读文字都必须被解释为节点、边标签、标题或注释。

OCR 不应该决定拓扑;它的作用是约束覆盖率。

结论二:更多推理有时反而更差

我们原以为密集图上的 medium 推理会优于 low,结果不是。带 OCR grounding 的 low 配置,是测试识别矩阵中唯一零遗漏的方案。提高推理强度有时给了模型更多“重组和总结”的自由,而不是忠实抄录图像结构。

这是结构化视觉任务的重要特征:需要的不是最优雅的解释,而是与像素一致、最不意外的对象清单。提示词应该奖励覆盖率、稳定 ID 和坐标忠实度,而不是抽象能力。

结论三:拓扑质量打平,成本相差 20 倍

五种拓扑观察配置的质量几乎打平。具有代表性的精确率/召回率约为 0.95~0.97 / 0.97~0.98

但实验时单次成本差异明显:

612 次图表重建实验告诉我们的:OCR、图形与连接线
  • Gemini 3.6 Flash:约 $0.0147

  • Gemini 3.1 Flash-Lite:约 $0.0028

  • Luna observer:约 $0.0007

如果质量差异落在噪声范围,架构就应选择便宜观察器,并保留另一家供应商作为故障回退。模型名气不是性能指标。

结论四:拓扑裁决模型几乎没有增加价值

我们让第二个模型裁决观察器产生的每条候选线路。所有观察器在裁决前后的精确率变化都不超过约 0.02,有时还会下降,因为观察器自身的幻觉率已经很低。

从提议架构中删除裁决器,可以省掉一次模型调用和大约 8~10 秒,实验中没有测到质量损失。

不要因为“再验证一次听起来更安全”就加入 LLM 验证器。必须测量它是否真的改变错误分布;只会同意第一个模型的验证器,本质上只是延迟。

结论五:廉价 CV 预检可以安全跳过昂贵阶段

线路检测预检在 12 张图中判断正确 11 张,更重要的是危险方向零错误:凡是预测“没有连接线”的图,确实都没有连接线。

误判“有线”只会失去一次提速机会;误判“无线”却会跳过必要拓扑处理并破坏结果。安全的提前退出应按两个错误方向的代价设计,而不能只看总准确率。

结论六:某些拓扑错误来自源像素

两张生成测试图的标准答案描述的是扇出结构,但肘形线路实际穿过了相邻节点,像素上看起来是链式连接。所有观察器都一致读成链式。模型没有错,测试图错了。

把线路改到清晰走廊后,模型结果与目标拓扑一致。这揭示了产品事实:图的逻辑意图和实际绘制可能矛盾。连接线穿过节点边框,或者多线共用狭窄通道时,人也可能判断错端点。

重建系统应该把这种源图歧义暴露给人工复核,而不是藏在一个置信度分数后面。

实验建议的新架构

  • OCR 与快速识别器并行执行;

  • 仅在密集或低质量案例启用带 OCR 的高召回 hedge;

  • 拓扑前先执行廉价 CV 预检;

  • 使用一个低成本拓扑观察器,并准备跨供应商回退;

  • 删除独立拓扑裁决器;

  • 让分割和拓扑阶段重叠执行;

  • 文件生成由确定性代码完成,并验证包结构。

实验报告中的预计变化是:典型路径从约 47 秒降至约 30 秒,单次模型成本从约 $0.03 降至 $0.015。这是实验得出的架构估算,不是对所有生产图片的保证。

局限与下一步

12 张图仍是小数据集,并且为了获得精确标准答案,生成图占比偏高。它足够支持本产品的流水线决策,但不能当作通用视觉模型排行榜。

下一步需要增加真实、多语言、低质量截图;按文字密度、交叉线和图标数量分层评分;在 Visio、PowerPoint、LibreOffice 与 draw.io 中做文件级测试;把人工修正时间也作为指标;并将模糊失败样本持续补入基准集。

更大的结论

可编辑图表重建不是“OCR 加 SVG 描摹”,而是同时处理三类事实的结构化感知问题:

  • 语义事实:图里有哪些对象;

  • 几何事实:对象在哪里;

  • 拓扑事实:对象怎样连接。

测试中最好的方向并不是让一个昂贵模型解决全部问题,而是用 OCR 约束覆盖率、把拓扑专门处理、删除无价值裁决器,再用确定性代码生成文件。

这套架构服务于一个实际产品问题:把图表截图变成可编辑的 VSDX、PPTX、draw.io 和 SVG。漂亮预览并不难;难的是下一次编辑时,文字、图形和连接线仍然保持结构。

作者提示含AI生成内容。作者声明本文存在利益相关性,请大家尊重作者及分享的内容,友善沟通,理性决策~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松