图表推理是多模态大模型的短板,现有合成数据又普遍“太简单、易幻觉”。北京大学推出的ChartVerse框架,提出一套完全基于代码的数据合成方案,从零开始构建高复杂度、高准确性的图表数据,显著提升了开源模型的推理能力,为数据质量瓶颈提供了全新解法。
智能速览
图表推理是多模态模型的关键短板,数据是核心瓶颈。
ChartVerse提出完全基于代码的图表与推理数据合成框架。
通过RPE指标精准筛选高复杂度图表,避免“太简单”问题。
采用反向QA生成机制,确保问答数据的“可执行真值”。
实证表明小模型在优质数据下可超越规模更大的教师模型。
精华内容
ChartVerse框架如何通过代码从根本上提升数据质量,其核心在于一套环环相扣的创新机制,确保了数据的复杂度与真实性。
度量真实复杂度
传统方法难以评估图表真实复杂度,导致合成的数据过于简单。ChartVerse提出Rollout Posterior Entropy(RPE)指标,它通过“图像→代码→重绘”的多次重复过程,测量结果的不稳定性。一个图表越难被代码稳定复现,其RPE值就越高,表明其内在逻辑越复杂。这个方法跳过了表面特征,直击核心,能精准筛选出真正有挑战性的图表样本用于模型训练。
从零合成图表
为避免依赖模板造成的同质化,ChartVerse训练了一个代码生成模型。在高温采样下,该模型能自主创造出多样化的高复杂度图表代码。生成的图表会经过RPE指标和相似度双重过滤,剔除简单或重复的样本。这个过程会进行多轮自增强,形成一个持续优化的闭环,最终构建出规模庞大且复杂的图表代码库,保证了数据源的多样性与难度。
锚定正确答案
为了彻底根除合成数据中的“幻觉”问题,ChartVerse采用了“答案优先”的反向QA生成策略。它首先根据图表代码生成绝对正确的数值答案,然后基于这个“真值”反向生成对应的问题。生成的问题与答案还会经过一致性校验,确保二者逻辑自洽。这种A→Q的模式,从源头保证了每一条问答对的可验证性和准确性,为模型提供了高质量的监督信号。
数据质量为王
基于上述方法,ChartVerse构建了包含60万样本的SFT数据集和4万样本的RL数据集。最令人瞩目的成果是,一个仅80亿参数(8B)的小模型,在经过这些高质量数据训练后,在多项图表推理基准测试中的表现,竟全面超过了其300亿参数(30B)的教师模型,并逼近了320亿参数(32B)的更大规模模型。这一结果有力地验证了“数据质量优于模型规模”的观点,为AI发展提供了新思路。
ChartVerse的研究不仅为图表推理领域提供了高质量的数据集和有效方法,更实证了“数据质量优于模型规模”的可能性。这为资源有限的开发者开辟了新路径,也引发了对AI发展方向的深入思考:当数据瓶颈被打破,小模型将释放多大潜力?