张大妈

多智能体漏洞检测新SOTA

源自小红薯:🎃量子智心

03-04 19:02

自动化代码漏洞检测长期受困于漏洞模式多样性与提示工程难题。一项名为MulVul的研究通过多智能体协作与跨模型提示演化机制,显著提升了检测精度与广度。该框架不仅能有效应对不同类型的漏洞,还大幅降低了人工成本,为构建更安全的软件系统提供了新思路。

多智能体漏洞检测新SOTA智能速览

  • 现有LLM在漏洞检测中面临模式异质性与提示工程两大局限。

  • MulVul框架采用Router与Detector多智能体协作,实现由粗到细的漏洞检测。

  • 跨模型提示演化机制自动生成专业提示,性能超越人工设计51.6%。

  • 检索增强技术为智能体提供知识库证据,有效降低模型误报率。

  • 在包含130种CWE类型的PrimeVul数据集上,Macro-F1达到34.79%,创下新SOTA。

多智能体漏洞检测新SOTA精华内容

MulVul的突破性在于,它不再是单一模型单打独斗,而是构建了一个分工明确、协同进化的智能体团队,共同攻克漏洞检测难题。

多智能体分工协作

面对漏洞模式的高度异质性,MulVul创新性地采用了多智能体分工架构。Router智能体首先对代码进行广度筛查,预测出最可能的前k个漏洞类别。随后,这些类别被分配给专业的Detector智能体进行深度分析。

这种由粗到细的策略,让不同智能体可以聚焦于特定领域。例如,处理内存错误与注入攻击的逻辑截然不同,专门的Detector能更精准地捕捉各自的特征。整个过程,智能体都能调用检索工具从知识库获取证据,有效降低了大型语言模型产生“幻觉”的风险。

提示自动演化

MulVul的核心突破在于其跨模型提示演化机制。传统的单模型自我修正容易陷入固有的认知偏差。MulVul则解耦了提示的生成与评估过程:由生成器LLM(如Claude)提出候选提示,再由不同的执行器LLM(如GPT-4o)进行效果评估和筛选。

这种“提出-验证”的演化模式,避免了模型偏见,生成的提示更具鲁棒性。实验证明,该机制的性能比人工设计的提示高出51.6%。尤其在样本稀少的少样本CWE类型上,其F1分数几乎是基线的两倍,展现出强大的泛化能力。

检索增强减少误报

检索增强技术在MulVul框架中扮演着关键角色,是确保检测准确性的“压舱石”。Router智能体在广度筛选阶段,会利用SCALE结构化表示和全局检索策略,快速定位相关的漏洞知识。

而Detector智能体在进行深度分析时,则采用更精细的对比检索策略。它会同时检索正例、负例和难以分辨的“难例”,通过对比学习来强化判断逻辑,从而显著降低误报率。这一设计巧妙地平衡了检测的精度与召回率,使整体表现更为可靠。

实验数据验证效果

实验数据充分验证了MulVul的卓越性能。在包含130种CWE漏洞类型的PrimeVul基准数据集上,MulVul取得了34.79%的Macro-F1分数,相较于之前的最优基线提升了41.5%,刷新了该领域的SOTA记录。

消融实验进一步证实了框架中各模块的有效性。其中,跨模型提示演化机制的作用尤为关键,其带来的性能提升高达51.6%。这一系列数据表明,多智能体协作与自动化提示优化的结合,是推动代码漏洞检测技术进步的有效路径。

MulVul框架通过多智能体协作与提示自动演化,为代码漏洞检测领域带来了范式级的革新。它不仅在关键指标上实现了显著突破,更重要的是提供了一套可复现、低成本的自动化方案。未来,这种多智能体协同的思路能否应用于更广泛的代码分析与软件工程任务中?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章