612 次图表重建实验告诉我们的:OCR、图形与连接线
把图表图片转换成可编辑对象,听起来只需调用一次视觉模型:让它输出方框、文字和箭头,再生成文件。这个原型在干净流程图上可行,一旦遇到真实架构图中的小字、重复图标、嵌套容器、并行线路和拥挤走线,就会暴露问题。
为了找到 LayerBack 图片转可编辑图表流程中的质量损失点,我们做了一组受控实验:336 次结构识别,加 276 次拓扑识别,总计 612 次模型运行,覆盖 12 张图。其中 10 张生成图有精确标准答案,另有 2 张真实图。
目标并不是宣布一个通用“最佳模型”,而是回答几个具体工程问题:
OCR 清单能否减少节点遗漏?
提高推理强度会不会改善结构抽取?
哪种模型更适合观察连接拓扑?
是否需要第二个模型裁决候选线路?
对于没有线路的图,能否安全跳过拓扑阶段?
被拆开的处理流程
基线流程分为:
OCR 提取文字与坐标;
多模态模型识别节点、类型、位置和样式;
确定性代码把 OCR 文字合并到结构中;
拓扑观察器根据已知节点目录追踪连接线;
可选的裁决模型接受或拒绝候选边;
分割模型提取图标与自定义插画;
确定性序列化生成 draw.io、VSDX、PPTX、SVG 和预览。
拆开后,文字遗漏与虚构连接线成为两个可独立衡量的问题,不需要不断加长同一个提示词来同时修补。
结论一:OCR 不是兜底,而是 grounding
最强的识别配置把明确的 OCR 清单交给视觉模型。terra-low-ocr 在 33 次测量中,节点召回率平均值和最小值都是 1.00 / 1.00。快速配置 luna-low 平均为 0.93,但在困难案例中最低只有 0.32。
重点不在模型名称,而是可见文字能成为检查清单。模型即使理解了整张图,也可能省略一个小型数据库标签,或者一排重复卡片中的某一项。提供 OCR 文本与坐标后,每段可读文字都必须被解释为节点、边标签、标题或注释。
OCR 不应该决定拓扑;它的作用是约束覆盖率。
结论二:更多推理有时反而更差
我们原以为密集图上的 medium 推理会优于 low,结果不是。带 OCR grounding 的 low 配置,是测试识别矩阵中唯一零遗漏的方案。提高推理强度有时给了模型更多“重组和总结”的自由,而不是忠实抄录图像结构。
这是结构化视觉任务的重要特征:需要的不是最优雅的解释,而是与像素一致、最不意外的对象清单。提示词应该奖励覆盖率、稳定 ID 和坐标忠实度,而不是抽象能力。
结论三:拓扑质量打平,成本相差 20 倍
五种拓扑观察配置的质量几乎打平。具有代表性的精确率/召回率约为 0.95~0.97 / 0.97~0.98。
但实验时单次成本差异明显:

Gemini 3.6 Flash:约 $0.0147;
Gemini 3.1 Flash-Lite:约 $0.0028;
Luna observer:约 $0.0007。
如果质量差异落在噪声范围,架构就应选择便宜观察器,并保留另一家供应商作为故障回退。模型名气不是性能指标。
结论四:拓扑裁决模型几乎没有增加价值
我们让第二个模型裁决观察器产生的每条候选线路。所有观察器在裁决前后的精确率变化都不超过约 0.02,有时还会下降,因为观察器自身的幻觉率已经很低。
从提议架构中删除裁决器,可以省掉一次模型调用和大约 8~10 秒,实验中没有测到质量损失。
不要因为“再验证一次听起来更安全”就加入 LLM 验证器。必须测量它是否真的改变错误分布;只会同意第一个模型的验证器,本质上只是延迟。
结论五:廉价 CV 预检可以安全跳过昂贵阶段
线路检测预检在 12 张图中判断正确 11 张,更重要的是危险方向零错误:凡是预测“没有连接线”的图,确实都没有连接线。
误判“有线”只会失去一次提速机会;误判“无线”却会跳过必要拓扑处理并破坏结果。安全的提前退出应按两个错误方向的代价设计,而不能只看总准确率。
结论六:某些拓扑错误来自源像素
两张生成测试图的标准答案描述的是扇出结构,但肘形线路实际穿过了相邻节点,像素上看起来是链式连接。所有观察器都一致读成链式。模型没有错,测试图错了。
把线路改到清晰走廊后,模型结果与目标拓扑一致。这揭示了产品事实:图的逻辑意图和实际绘制可能矛盾。连接线穿过节点边框,或者多线共用狭窄通道时,人也可能判断错端点。
重建系统应该把这种源图歧义暴露给人工复核,而不是藏在一个置信度分数后面。
实验建议的新架构
OCR 与快速识别器并行执行;
仅在密集或低质量案例启用带 OCR 的高召回 hedge;
拓扑前先执行廉价 CV 预检;
使用一个低成本拓扑观察器,并准备跨供应商回退;
删除独立拓扑裁决器;
让分割和拓扑阶段重叠执行;
文件生成由确定性代码完成,并验证包结构。
实验报告中的预计变化是:典型路径从约 47 秒降至约 30 秒,单次模型成本从约 $0.03 降至 $0.015。这是实验得出的架构估算,不是对所有生产图片的保证。
局限与下一步
12 张图仍是小数据集,并且为了获得精确标准答案,生成图占比偏高。它足够支持本产品的流水线决策,但不能当作通用视觉模型排行榜。
下一步需要增加真实、多语言、低质量截图;按文字密度、交叉线和图标数量分层评分;在 Visio、PowerPoint、LibreOffice 与 draw.io 中做文件级测试;把人工修正时间也作为指标;并将模糊失败样本持续补入基准集。
更大的结论
可编辑图表重建不是“OCR 加 SVG 描摹”,而是同时处理三类事实的结构化感知问题:
语义事实:图里有哪些对象;
几何事实:对象在哪里;
拓扑事实:对象怎样连接。
测试中最好的方向并不是让一个昂贵模型解决全部问题,而是用 OCR 约束覆盖率、把拓扑专门处理、删除无价值裁决器,再用确定性代码生成文件。
这套架构服务于一个实际产品问题:把图表截图变成可编辑的 VSDX、PPTX、draw.io 和 SVG。漂亮预览并不难;难的是下一次编辑时,文字、图形和连接线仍然保持结构。
作者提示含AI生成内容。作者声明本文存在利益相关性,请大家尊重作者及分享的内容,友善沟通,理性决策~
