张大妈

Token 砍半,效果更好?SWE-Pruner 如何解决 AI 编程“上下文爆炸”难题

源自UP主:AI_打工人

02-18 11:06

针对AI编程智能体“读多、费钱、易晕”的痛点,SWE-Pruner通过任务感知的行级剪枝技术,像人类一样选择性浏览代码,大幅降低Token消耗并提升任务成功率。

Token 砍半,效果更好?SWE-Pruner 如何解决 AI 编程“上下文爆炸”难题智能速览

  • AI智能体76%的Token消耗在“读取”操作上,存在“上下文墙”瓶颈

  • SWE-Pruner采用行级剪枝,保留代码语法结构,AST正确率达87.3%

  • 利用Teacher-Student范式合成高质量训练数据,训练0.6B轻量级模型

  • 在SWE-Bench测试中,Token消耗降低23%-54%,任务成功率反升1.4%

  • 推理延迟小于100ms,可作为中间件即插即用

Token 砍半,效果更好?SWE-Pruner 如何解决 AI 编程“上下文爆炸”难题精华内容

针对AI编程中低效的全量读取问题,SWE-Pruner提供了仿生学的解决方案。

上下文之墙

AI编程智能体面临严重的资源浪费,数据显示超过76%的Token消耗用于读取代码,而非编辑或执行。这种全量输入不仅导致API成本高昂,还会引发注意力稀释,使模型在噪音中迷失方向。传统压缩方案如RAG或Token级剪枝,往往会破坏代码的语法结构,导致AST正确率低至0.29%,使得代码无法运行。

仿生学设计

SWE-Pruner模仿人类程序员的“选择性浏览”习惯,通过Goal Hint明确任务目标,对代码进行行级剪枝。这种方法保留了完整的代码行和语法结构,确保剪枝后的代码依然可执行。相比Token级处理,行级剪枝将AST正确率提升至87.3%,有效解决了代码结构被破坏的难题。

轻量级架构

该方案采用一个仅0.6B参数的轻量级神经筛选器作为核心,推理延迟控制在100毫秒以内,比32B参数模型快7.5倍。模型使用条件随机场(CRF)技术,显式建模代码行的连续性,避免孤立的二分类决策。通过中间件设计,它能无缝拦截并处理智能体的读取指令,实现即插即用。

数据合成

面对缺乏标注数据的挑战,研究团队利用Teacher-Student范式合成训练数据。利用30B参数的强模型阅读GitHub代码并自动生成任务查询与二进制标签,再由80B参数的模型进行质检。最终利用这6万余条高质量合成数据,成功训练出了具备精准筛选能力的轻量级学生模型。

实测效果

在SWE-Bench Verified测试集上,SWE-Pruner将Token消耗降低了23%至54%,智能体的交互轮次减少了20.2%。更关键的是,通过去除噪音聚焦核心逻辑,任务成功率反而提升了1.2%至1.4%。这意味着在大幅降本提效的同时,并没有牺牲解决问题的能力,反而实现了精准度的跃升。

SWE-Pruner证明了教会AI“忽略”比单纯增加上下文更重要。未来,让AI学会聚焦而非博学,或将是提升智能效率的关键路径。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章