训练终端智能体常受限于环境数据不足。斯坦福与微软的研究提出Endless Terminals,一个能自动生成海量终端任务的流水线,为强化学习提供了可扩展的训练场,显著提升了模型性能。
智能速览
Endless Terminals是一个全自动生成终端任务的流水线。
该流水线无需人工标注,已生成3255个任务。
训练后,模型在自建基准上性能提升超3倍。
这种性能提升同样迁移到了人工策划的基准测试中。
研究表明,简单RL配合大规模环境即可取得成功。
精华内容
那么,这个全自动流水线具体是如何运作的?又带来了哪些实质性的提升呢?
全自动流水线
Endless Terminals是一个完全自主的流水线,旨在程序化生成终端任务,摆脱对人工标注的依赖。其流程分为四个阶段:首先,生成多样化的任务描述;接着,构建并验证容器化环境以确保任务可执行;然后,生成用于评估完成度的测试用例;最后,筛选出可解的任务。通过该流程,研究团队成功获得了3255个覆盖文件操作、日志管理、数据处理、脚本编写和数据库操作等多个领域的终端任务。
简洁训练法
研究人员采用原生的PPO算法进行智能体训练,方法极其简洁:使用二元回合级奖励,没有引入检索增强、多智能体协作或专门工具。尽管方法简单,但效果显著。在Endless Terminals的预留开发集上,Llama-3.2-3B模型的成功率从4.0%提升至18.2%;Qwen2.5-7B从10.7%跃升至53.3%;而Qwen3-8B-openthinker-sft也从42.6%提升至59.0%,性能增长幅度巨大。
性能可迁移
更关键的是,在Endless Terminals上获得的性能提升能够有效迁移到其他人工策划的基准测试中。在TerminalBench 2.0上,Llama-3.2-3B从0.0%提升至2.2%,Qwen2.5-7B从2.2%提升至3.4%,Qwen3-8B-openthinker-sft从1.1%大幅提升至6.7%。在所有测试中,这种简单方法的表现均优于其他采用更复杂智能体支架的方法,证明了其泛化能力。
Endless Terminals的研究证明,通过自动化扩展环境,即便使用简单的强化学习算法,也能有效推动终端智能体的能力边界。这为未来智能体的自主训练开辟了新的可能性。