如何让大模型智能体处理长达数小时的复杂任务?KLong论文提出了解决方案,突破了上下文窗口限制,能处理700+轮交互,为AI科研自动化提供了新思路。
智能速览
界定了“极长程任务”的标准,如运行可达12小时。
指出现有SFT和RL方法难以处理超出上下文窗口的轨迹。
提出“冷启动-扩展”范式解决超长轨迹训练难题。
设计轨迹分割SFT和渐进式RL技术提升模型能力。
构建Research-Factory自动化生成高质量训练数据。
精华内容
随着AI向科研领域渗透,处理耗时极长的任务成为关键。KLong通过创新的训练范式,让智能体不仅能“读”论文,更能“复现”论文。
极长程任务挑战
普通长程任务通常在几十轮交互内完成,而极长程任务则截然不同。这类任务运行时间可达12小时,约为普通任务的10倍。同时,助手轮次常超过700轮,远超现有方法处理的20-200轮范围。核心挑战在于任务轨迹必然超出模型的最大上下文窗口,若不进行有效管理,模型将无法处理。
现有方法局限
现有的LLM智能体训练方法存在明显短板。大多数模型仅使用32K等有限上下文窗口,无法直接容纳极长轨迹。此外,标准的监督微调(SFT)和强化学习(RL)难以处理超出窗口的数据。加之缺乏高质量的训练数据,特别是涉及机器学习工程和终端交互的复杂场景,使得现有方案难以为继。
冷启动扩展范式
论文提出了“冷启动-扩展”训练范式以应对上述挑战。通过轨迹分割SFT技术,将超长轨迹分解为适应上下文窗口的片段,并保持子轨迹重叠以维持连贯性。同时采用渐进式RL,分阶段逐步延长任务超时时间,使模型能够稳定学习并适应极长程任务的需求。
自动化数据工厂
为解决数据稀缺问题,研究团队设计了Research-Factory自动化流水线。该系统直接从顶会论文构建高质量训练数据和评估标准。这不仅解决了数据量不足的问题,更确保了数据在机器学习工程和研究复现场景下的专业性与实用性。
KLong为训练具备长期工作能力的AI智能体提供了系统性方案,有望加速科研自动化进程。未来,AI是否能完全独立完成从阅读到复现的全流程闭环,值得期待。