张大妈

Agent新范式:P-ReAct加速

源自小红薯:🎃量子智心

02-28 15:25

传统搜索智能体(ReAct)的串行执行机制存在延迟瓶颈。而扩散大语言模型虽有潜力,但推理和工具调用能力不足。为解决这两大挑战,DLLM-Searcher框架应运而生,它通过增强模型能力并提出P-ReAct新范式,实现了高效且准确的搜索,为AI Agent的落地应用提供了新思路。

Agent新范式:P-ReAct加速智能速览

  • 传统ReAct范式串行执行,导致端到端延迟。

  • 现有扩散大语言模型(dLLM)的Agent能力薄弱。

  • DLLM-Searcher框架旨在解决dLLM能力弱和ReAct延迟高的问题。

  • 通过两阶段后训练提升模型信息检索与推理能力。

  • 提出P-ReAct范式,实现“边思考边等待”的并行执行。

  • 实验表明性能媲美主流智能体,推理速度提升约15%。

Agent新范式:P-ReAct加速精华内容

DLLM-Searcher框架的两大核心创新,分别从模型能力和执行流程入手,双管齐下,共同构筑了新一代高效搜索智能体的技术基石。

增强模型能力

为克服扩散大语言模型(dLLM)在Agent场景下的能力短板,研究设计了包含Agentic SFT和Agentic VRPO的两阶段后训练流程。该流程针对性地增强了模型的信息检索与推理能力,使其能够更好地理解任务指令、调用工具并生成高质量结果,为后续的高效执行打下了坚实的模型基础。

重构执行范式

针对传统ReAct范式串行执行带来的延迟问题,研究提出了P-ReAct新范式。该范式通过预填充边界标记和置信度偏置,巧妙地引导模型在生成思考过程的同时,优先解码工具调用指令。这种“边思考边等待”的并行机制,显著缩短了整体的端到端响应时间。

实验性能验证

在四个多跳问答基准数据集上的实验充分验证了框架的有效性。结果显示,DLLM-Searcher的性能能够媲美基于ARM的主流智能体。更重要的是,得益于P-ReAct范式的并行执行优势,其推理速度获得了约15%的显著提升,成功兼顾了准确性与效率。

DLLM-Searcher框架通过增强dLLM的Agent能力与创新P-ReAct执行范式,成功平衡了搜索智能体的性能与效率。这一突破不仅为解决Agent延迟问题提供了可行方案,也启发了对大模型并行推理机制的进一步探索。未来,这种并行化思路能否在更多复杂任务中展现其潜力?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章