张大妈

KLong:训练LLM代理进行超长程任务

源自小红薯:刘东瑞 上海 AI Lab

03-01 14:43

如何让大模型智能体处理长达数小时的复杂任务?KLong论文提出了解决方案,突破了上下文窗口限制,能处理700+轮交互,为AI科研自动化提供了新思路。

KLong:训练LLM代理进行超长程任务智能速览

  • 界定了“极长程任务”的标准,如运行可达12小时。

  • 指出现有SFT和RL方法难以处理超出上下文窗口的轨迹。

  • 提出“冷启动-扩展”范式解决超长轨迹训练难题。

  • 设计轨迹分割SFT和渐进式RL技术提升模型能力。

  • 构建Research-Factory自动化生成高质量训练数据。

KLong:训练LLM代理进行超长程任务精华内容

随着AI向科研领域渗透,处理耗时极长的任务成为关键。KLong通过创新的训练范式,让智能体不仅能“读”论文,更能“复现”论文。

极长程任务挑战

普通长程任务通常在几十轮交互内完成,而极长程任务则截然不同。这类任务运行时间可达12小时,约为普通任务的10倍。同时,助手轮次常超过700轮,远超现有方法处理的20-200轮范围。核心挑战在于任务轨迹必然超出模型的最大上下文窗口,若不进行有效管理,模型将无法处理。

现有方法局限

现有的LLM智能体训练方法存在明显短板。大多数模型仅使用32K等有限上下文窗口,无法直接容纳极长轨迹。此外,标准的监督微调(SFT)和强化学习(RL)难以处理超出窗口的数据。加之缺乏高质量的训练数据,特别是涉及机器学习工程和终端交互的复杂场景,使得现有方案难以为继。

冷启动扩展范式

论文提出了“冷启动-扩展”训练范式以应对上述挑战。通过轨迹分割SFT技术,将超长轨迹分解为适应上下文窗口的片段,并保持子轨迹重叠以维持连贯性。同时采用渐进式RL,分阶段逐步延长任务超时时间,使模型能够稳定学习并适应极长程任务的需求。

自动化数据工厂

为解决数据稀缺问题,研究团队设计了Research-Factory自动化流水线。该系统直接从顶会论文构建高质量训练数据和评估标准。这不仅解决了数据量不足的问题,更确保了数据在机器学习工程和研究复现场景下的专业性与实用性。

KLong为训练具备长期工作能力的AI智能体提供了系统性方案,有望加速科研自动化进程。未来,AI是否能完全独立完成从阅读到复现的全流程闭环,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章