针对AI编程智能体“读多、费钱、易晕”的痛点,SWE-Pruner通过任务感知的行级剪枝技术,像人类一样选择性浏览代码,大幅降低Token消耗并提升任务成功率。
智能速览
AI智能体76%的Token消耗在“读取”操作上,存在“上下文墙”瓶颈
SWE-Pruner采用行级剪枝,保留代码语法结构,AST正确率达87.3%
利用Teacher-Student范式合成高质量训练数据,训练0.6B轻量级模型
在SWE-Bench测试中,Token消耗降低23%-54%,任务成功率反升1.4%
推理延迟小于100ms,可作为中间件即插即用
精华内容
针对AI编程中低效的全量读取问题,SWE-Pruner提供了仿生学的解决方案。
上下文之墙
AI编程智能体面临严重的资源浪费,数据显示超过76%的Token消耗用于读取代码,而非编辑或执行。这种全量输入不仅导致API成本高昂,还会引发注意力稀释,使模型在噪音中迷失方向。传统压缩方案如RAG或Token级剪枝,往往会破坏代码的语法结构,导致AST正确率低至0.29%,使得代码无法运行。
仿生学设计
SWE-Pruner模仿人类程序员的“选择性浏览”习惯,通过Goal Hint明确任务目标,对代码进行行级剪枝。这种方法保留了完整的代码行和语法结构,确保剪枝后的代码依然可执行。相比Token级处理,行级剪枝将AST正确率提升至87.3%,有效解决了代码结构被破坏的难题。
轻量级架构
该方案采用一个仅0.6B参数的轻量级神经筛选器作为核心,推理延迟控制在100毫秒以内,比32B参数模型快7.5倍。模型使用条件随机场(CRF)技术,显式建模代码行的连续性,避免孤立的二分类决策。通过中间件设计,它能无缝拦截并处理智能体的读取指令,实现即插即用。
数据合成
面对缺乏标注数据的挑战,研究团队利用Teacher-Student范式合成训练数据。利用30B参数的强模型阅读GitHub代码并自动生成任务查询与二进制标签,再由80B参数的模型进行质检。最终利用这6万余条高质量合成数据,成功训练出了具备精准筛选能力的轻量级学生模型。
实测效果
在SWE-Bench Verified测试集上,SWE-Pruner将Token消耗降低了23%至54%,智能体的交互轮次减少了20.2%。更关键的是,通过去除噪音聚焦核心逻辑,任务成功率反而提升了1.2%至1.4%。这意味着在大幅降本提效的同时,并没有牺牲解决问题的能力,反而实现了精准度的跃升。
SWE-Pruner证明了教会AI“忽略”比单纯增加上下文更重要。未来,让AI学会聚焦而非博学,或将是提升智能效率的关键路径。