张大妈

Token砍半,效果更好?SWE-Pruner如何解决AI编 这篇论文主要解决的是目前AI编程智能体(CodingAgents)面临的个核心痛点:“读得太多,不仅贵,还容易晕”

源自抖音:AI 打工人

02-21 11:43

AI编程智能体常因处理海量代码而陷入“读得太多,不仅贵,还容易晕”的困境。SWE-Pruner技术应运而生,它为AI戴上“智能眼镜”,通过智能剪枝过滤无关信息,直击任务核心。这不仅能大幅降低计算成本,还能提升决策精度和工作效率,为AI编程领域带来了新的解决思路。

Token砍半,效果更好?SWE-Pruner如何解决AI编 这篇论文主要解决的是目前AI编程智能体(CodingAgents)面临的个核心痛点:“读得太多,不仅贵,还容易晕”智能速览

  • AI编程智能体超76%的资源被消耗在阅读代码上。

  • SWE-Pruner模仿人类专家进行选择性浏览,聚焦核心代码。

  • 其核心的行级剪枝技术,能将代码语法正确率维持在87.3%。

  • 该工具具备任务感知能力,根据目标动态调整保留的代码。

  • 实测Token消耗降低23%至54%,任务成功率不降反升。

  • 作为轻量级中间件,它实现了降本、增速、提效的三赢。

Token砍半,效果更好?SWE-Pruner如何解决AI编 这篇论文主要解决的是目前AI编程智能体(CodingAgents)面临的个核心痛点:“读得太多,不仅贵,还容易晕”精华内容

SWE-Pruner究竟是如何突破限制,让AI编程实现降本增效的?其背后精巧的设计与实现,正是我们接下来要深入探讨的核心。

上下文的困境

当前AI编程智能体面临一个核心瓶颈:过多的计算资源被浪费在阅读无关代码上。数据显示,一个智能体高达76.1%的资源用于读代码,而非实际的编辑和执行。这不仅成本高昂,更严重的是,过量的信息会引发“注意力稀释”现象,导致模型在嘈杂信息中抓不住重点,甚至产生幻觉。

传统的基于Token粒度的压缩方法,如RAG,对于高度结构化的代码是致命的。随机删减可能破坏代码的语法结构,导致其抽象语法树(AST)正确率暴跌至0.29%,几乎等同于无效代码。

智能剪枝三板斧

SWE-Pruner的核心设计,是模仿人类程序员“选择性浏览”的习惯。其第一个特点是行级剪枝,以完整的代码行为单位进行删减,最大程度保护了代码的语法结构,将AST正确率从0.29%提升至87.3%。

其次是任务感知能力,剪裁完全服务于AI当前的具体目标。例如修复登录漏洞时,它会重点保留用户认证相关代码行。第三个特点是自适应,它不追求固定的压缩率,而是根据任务复杂度和文件相关性,动态决定保留多少上下文,力求恰到好处。

轻量级引擎驱动

SWE-Pruner被设计成一个即插即用的中间件,无缝集成在AI智能体和代码库之间。当AI请求读取文件时,SWE-Pruner会拦截请求,并询问其任务目标,然后返回精简后的代码。

其决策核心是一个仅0.6B参数的轻量级神经选筛器。它采用双路径设计,主路径使用CRF(条件随机场)技术来判断代码行的取舍,能够学习行与行之间的逻辑依赖,确保剪裁后的代码片段依然连贯可读,避免出现只保留if语句却删除执行体的尴尬情况。

高质量数据合成

训练这样一个模型需要大量标注数据,但市面上并无现成数据集。研究者巧妙地采用“教师-学生”范式来合成数据。

他们先让一个30B参数的大模型扮演“教师”,阅读GitHub开源代码并自我提问,生成“问题-答案”对(答案即二进制标注)。为保证质量,一个更强大的80B参数模型会扮演“法官”,对所有数据进行严格质检,淘汰率高达六分之五。最终,超过6万个高质量样本被用于训练那个0.6B的轻量级学生模型。

三赢的实践成果

在SWE-Bench测试集上,SWE-Pruner的效果显著。首先是成本,AI完成任务的总Token消耗降低了23%到54%。其次是速度,解决问题的平均交互轮次减少了20.2%,意味着AI能更快地锁定核心问题。

最令人惊讶的是精度,任务的成功率不降反升,提升了1.2%至1.4%。这证明了减少信息噪音,反而能让AI做出更高质量的决策。同时,其作为中间件的单次推理延迟始终低于100毫秒,几乎不会影响整体工作流。

SWE-Pruner的成功,不仅是为AI编程提供了一个高效工具,更启发了我们重新审视AI的发展路径。教会AI如何聚焦和忽略,可能比单纯扩大模型规模更为关键。未来,还有哪些人类的高效认知模式可以被赋予AI,这或许是通向更高智能的另一条重要路径。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章