传统搜索智能体(ReAct)的串行执行机制存在延迟瓶颈。而扩散大语言模型虽有潜力,但推理和工具调用能力不足。为解决这两大挑战,DLLM-Searcher框架应运而生,它通过增强模型能力并提出P-ReAct新范式,实现了高效且准确的搜索,为AI Agent的落地应用提供了新思路。
智能速览
传统ReAct范式串行执行,导致端到端延迟。
现有扩散大语言模型(dLLM)的Agent能力薄弱。
DLLM-Searcher框架旨在解决dLLM能力弱和ReAct延迟高的问题。
通过两阶段后训练提升模型信息检索与推理能力。
提出P-ReAct范式,实现“边思考边等待”的并行执行。
实验表明性能媲美主流智能体,推理速度提升约15%。
精华内容
DLLM-Searcher框架的两大核心创新,分别从模型能力和执行流程入手,双管齐下,共同构筑了新一代高效搜索智能体的技术基石。
增强模型能力
为克服扩散大语言模型(dLLM)在Agent场景下的能力短板,研究设计了包含Agentic SFT和Agentic VRPO的两阶段后训练流程。该流程针对性地增强了模型的信息检索与推理能力,使其能够更好地理解任务指令、调用工具并生成高质量结果,为后续的高效执行打下了坚实的模型基础。
重构执行范式
针对传统ReAct范式串行执行带来的延迟问题,研究提出了P-ReAct新范式。该范式通过预填充边界标记和置信度偏置,巧妙地引导模型在生成思考过程的同时,优先解码工具调用指令。这种“边思考边等待”的并行机制,显著缩短了整体的端到端响应时间。
实验性能验证
在四个多跳问答基准数据集上的实验充分验证了框架的有效性。结果显示,DLLM-Searcher的性能能够媲美基于ARM的主流智能体。更重要的是,得益于P-ReAct范式的并行执行优势,其推理速度获得了约15%的显著提升,成功兼顾了准确性与效率。
DLLM-Searcher框架通过增强dLLM的Agent能力与创新P-ReAct执行范式,成功平衡了搜索智能体的性能与效率。这一突破不仅为解决Agent延迟问题提供了可行方案,也启发了对大模型并行推理机制的进一步探索。未来,这种并行化思路能否在更多复杂任务中展现其潜力?