大语言模型的工具调用能力受限于静态数据生成流程,难以动态优化。上海交大与小红书提出的LoopTool框架,通过构建数据-模型训练闭环,实现了工具调用任务的自动化迭代优化。该方案仅依赖开源模型,就让8B模型性能超越其32B教师模型,并在多个公开榜单上取得开源SOTA,验证了闭环进化的有效性。
智能速览
LoopTool首次实现了工具调用任务的数据-模型闭环优化。
该框架仅依赖开源模型,摆脱了对闭源API的依赖。
8B规模模型性能超越其32B数据生成器,登顶BFCL-v3榜单。
迭代训练能持续挖掘模型短板,避免性能停滞。
闭环优化提升了模型在通用任务和下游应用中的表现。
精华内容
传统工具调用训练依赖静态数据,模型无法感知自身短板。LoopTool通过构建“训练-测评-修正-扩展”的闭环,让数据与模型协同进化,精准攻克能力薄弱环节。
背景:工具调用的瓶颈
工具增强型大模型在API调用、代码执行等领域价值巨大,但其稳健性受限于静态训练数据。现有方法多采用“先生成数据,再训练模型”的流程,缺乏对模型学习状态的实时反馈。同时,依赖闭源API成本高昂,而使用开源模型又易引入标签噪声,降低训练效果。
方法:闭环数据进化
LoopTool的核心是构建自动化闭环,由模型性能反馈驱动数据优化。它包含种子数据构建与迭代优化两大阶段。迭代阶段细分为四个模块:GRPO强化学习训练、贪婪能力探测(筛选高价值样本)、判别引导标签校验(修正错误标签)和错误驱动数据扩展(生成新挑战样本)。
验证:登顶开源SOTA
实验结果显示,LoopTool-8B模型在BFCL-v3榜单上以74.93%的准确率位列同规模第一,并超越了其32B教师模型。LoopTool-32B更以79.32%的准确率登顶开源SOTA。在ACEBench评测中,LoopTool-8B同样取得同规模最佳成绩。对比实验显示,LoopTool性能随迭代持续提升,而静态训练在第二轮后便停滞下滑。
泛化:不止于工具调用
闭环优化不仅提升了工具调用能力,也增强了模型的泛化性能。LoopTool-8B在指令跟随和代码生成等通用任务上表现更优。在API-Bank、Spotify和GAIA等下游应用评测中,其解决实际问题的能力也得到显著增强,证明了该方法的有效性和通用性。
LoopTool成功构建了一个完全自动化、模型感知的数据进化闭环,为提升大模型工具调用能力提供了新范式。该方法摆脱了闭源API依赖,实现了数据与模型的协同进化,展现了开源生态的巨大潜力。未来,这种自适应优化机制能否应用于更广泛的AI训练领域?