面对数千步交互的极长任务,现有智能体常因上下文限制和训练难题而失效。KLong智能体为此而来,通过独特的三阶段训练法,有效提升了处理复杂、长周期任务的能力,为人工智能在科研等领域的深度应用打开了新的大门。
智能速览
现有智能体受限于上下文窗口,难以处理数千步的极长任务。
KLong利用Research-Factory从Claude轨迹中提炼高质量训练数据。
其核心训练法是轨迹分割SFT,通过分段重叠避免上下文爆炸。
采用渐进式强化学习,逐步延长任务时间以适应长时推理。
在PaperBench评测中,KLong以不到1/10参数量超越Kimi K2 Thinking。
在MLE-bench机器学习竞赛中,KLong取得了接近满分的金牌成绩。
精华内容
KLong的成功并非偶然,其背后是一套精心设计的训练策略。它如何一步步攻克极长任务的难关?其核心方法论值得深入探究。
极长任务之困
当前主流的LLM智能体在执行极长时间跨度任务时面临三大挑战。首先是上下文窗口的限制,通常仅为32K,而一个复杂的任务可能需要数千步交互,这远超模型的承载能力。其次,现有智能体多为短任务思维优化,缺乏处理复杂流程的规划能力,导致性能断崖式下降。最后,收集并利用包含数千步骤的完整轨迹数据极为困难,使得模型难以在真实科研场景中得到充分训练。
高质量数据生产
为解决训练数据稀缺的问题,研究团队构建了名为Research-Factory的数据生产系统。该系统内含搜索智能体和评估智能体,前者负责自动收集相关研究论文,后者则构建标准化的评估体系。借助这套系统,团队从Claude 4.5 Sonnet的推理轨迹中成功提炼出数千条高质量样本,每条样本都包含数千步的交互过程,为后续训练奠定了坚实的数据基础。
轨迹分割训练
传统的监督微调(SFT)方法试图将整条极长轨迹一次性喂给模型,这必然导致上下文窗口爆炸。KLong反其道而行,提出了轨迹分割SFT。该方法在训练时会保留轨迹的早期上下文,让模型牢记任务的起点和最终目标,同时逐步截断后期上下文以节省显存。为保证逻辑连贯性,它维持了子轨迹之间的重叠,确保推理过程能够自然延续。
渐进式强化学习
在基础训练之后,KLong采用渐进式强化学习(RL)进行能力进阶。其核心思想是将训练分解为多个可控阶段,并逐步延长任务的超时时间。例如,在第一阶段,模型仅有10分钟来解决问题,随着训练的深入,后续阶段的超时时间会逐步放宽到30分钟、1小时,让模型逐步适应并学会长时间推理,最终胜任极长周期的复杂任务。
KLong的提出,为处理复杂、长周期的AI任务提供了可复现的范本。它不仅在多项评测中展现了卓越性能,更重要的是其训练方法论为未来的智能体研究指明了新方向。这项技术将如何改变未来的科研与自动化工作流程,值得期待。