为了让AI能像人类一样操作电脑终端,数据是关键。英伟达的研究人员提出了一种新颖的数据工程框架,通过合成高质量的训练数据,成功让参数量远小于巨头的模型在终端任务上实现了性能反超,这为更轻量、高效的AI Agent发展铺平了道路。
智能速览
英伟达推出Terminal-Task-Gen数据框架
通过两阶段方法生成高质量终端训练数据
新模型Nemotron-Terminal性能显著提升
其14B模型超越GPT-OSS 120B等更大模型
证明高质量数据对AI终端能力至关重要
精华内容
这项研究的核心并非堆砌模型参数,而是另辟蹊径,聚焦于如何创造出能让模型高效学习的终端数据,从而实现“小材大用”的效果。
创新数据框架
英伟达的研究团队开发了一套名为Terminal-Task-Gen的数据工程框架,专门用于生成与终端环境交互的高质量合成数据。该框架包含两个关键阶段。第一阶段是数据转换,将来自数学、代码和软件工程等领域的现有高质量数据集(如16.3万个数学提示和3.5万个代码问题)适配为终端兼容的格式。
第二阶段是任务合成,旨在创建新颖且可执行的终端任务。研究人员采用两种方法:一是从科学计算等领域的种子问题出发,利用LLM教师模型将其扩充为带有真实输入文件和测试用例的完整软件工程任务;二是从9个领域的基本终端操作分类法中,组合3-5个技能生成多样化的任务。
性能实测结果
基于新框架训练出的Nemotron-Terminal模型,在Terminal-Bench 2.0基准测试中取得了突破性进展。与各自的基础模型相比,准确率实现了数倍增长:8B参数模型从2.47%提升至13.0%,14B模型从4.04%提升至20.2%,32B模型则从3.37%大幅提升至27.4%。
更值得关注的是,这些中小尺寸模型在与行业巨头的对比中毫不逊色。其中,14B参数的Nemotron-Terminal模型以20.2%的准确率超越了参数量达120B的GPT-OSS模型(18.7%)和Gemini 2.5 Flash(16.9%)。而32B版本则以27.4%的准确率,超过了拥有480B参数的Qwen3-Coder模型(23.9%)和GPT-5-Mini(24.0%)。
技术核心价值
这项研究的核心价值在于,它以强有力的证据证明了“数据质量优于模型规模”的可行性。在AI Agent需要与操作系统进行复杂交互的终端场景下,高质量的、针对性的训练数据成为解锁模型潜力的关键。通过精细化的数据工程,即使是参数量较小的模型,也能在特定任务上达到甚至超越远大于自己的前沿模型。
这不仅为训练更高效、更低成本的终端AI Agent提供了全新的技术范式,也为解决特定领域数据稀缺问题提供了可复用的思路,预示着AI的发展路径将更加多元化。
这项工作清晰地展示了高质量合成数据在提升特定领域能力上的巨大潜力。它不仅为终端交互型AI Agent的训练提供了新范式,也让人们看到,通往强大AI的道路并非只有“大力出奇迹”一条。未来,我们是否能见到更多通过数据工程实现的突破?