通用多模态大模型在门店巡检等场景中,常因数据噪声和领域错配导致误判和不一致。Ostrakon-VL项目通过一套包含高质量数据治理和多阶段训练的系统化方案,成功解决了这一难题,将模型能力从“能用”提升至“好用”,为AI在复杂业务场景的可靠落地提供了重要参考。
智能速览
提出QUAD数据治理方法,从源头提升训练数据质量。
采用多阶段训练策略,稳定迁移模型并增强输出可靠性。
构建ShopBench评测基准,精准衡量模型在门店场景的能力。
Ostrakon-VL在8B级别开源模型中,门店评测表现最优。
实验表明,高信号数据闭环比单纯扩大数据规模更关键。
模型在OCR、细粒度感知等真实巡检任务中表现稳健。
精华内容
通用模型在门店场景“水土不服”的背后,是数据、训练与评测三个层面的系统性错配。Ostrakon-VL正是围绕这三大核心问题展开,旨在构建一个端到端的解决方案,让AI真正能看懂门店。
数据治理新范式
为解决门店场景数据高噪声、低信噪比的问题,Ostrakon-VL提出了QUAD数据治理流程。该流程通过数据合成、多维度过滤、可学习性过滤、语义去重和能力覆盖再分配四个阶段,将原始的噪声候选数据精炼为高质量、高信息密度且能力覆盖均衡的训练集。消融实验表明,完整启用QUAD的四个步骤,能显著提升模型在门店评测基准ShopBench上的表现,证明了高质量数据闭环的关键作用。
三阶段训练策略
在高质量数据基础上,Ostrakon-VL采用三阶段训练策略实现领域对齐。第一阶段通过Caption Bootstrapping,让模型学会关注门店关键视觉证据。第二阶段采用Offline Curriculum Learning(OCL),按难度渐进式训练,缓解领域迁移带来的优化不稳定。第三阶段引入Mixed Preference Optimization(MPO),通过精细化偏好对训练,提升模型在细粒度证据和微小差异上的判别力,增强输出稳定性。
专属评测基准
为准确衡量模型在门店场景的能力,团队构建了ShopBench评测基准。该基准包含5818道题,视觉域分布与通用评测集形成独立聚类,且单图平均实例数(InsPerImg)高达13.0,体现了门店场景的高信息密度。此外,它还提出了VNR(视觉必要性比率)和VIF(视觉干扰因子)新指标,比传统MG指标更能精准诊断模型在复杂环境中的表现。
性能与权衡
在ShopBench评测中,Ostrakon-VL取得了60.1的平均分,在8B级别开源模型中位居第一,显著优于同规模通用模型。消融实验证实,QUAD数据治理和三阶段训练策略缺一不可。通用能力评测显示,其平均分(66.7)略低于基座模型,呈现“领域强化带来的通用退化”,但在关键能力上保持了较好水平,实现了门店落地可用性与通用能力保持的实用平衡。
Ostrakon-VL的工作证明了,通过精细化的数据治理与领域对齐训练,中小规模模型也能在特定垂直领域超越通用大模型。这套可复现的方案为AI深入复杂业务场景提供了新思路,未来如何平衡领域强化与通用能力,将是持续探索的方向。