当AI在开放科研问题上频频陷入逻辑套娃,百度百舸开源的LoongFlow提供了一种新解法:通过结构化复盘机制和混合进化记忆系统,显著提升AI解决非标问题的能力。它不是堆算力,而是重构智能体的思考路径。
智能速览
LoongFlow引入PES范式,强制AI在执行前后完成目标对齐与失败归因
混合进化记忆系统包含平行探索、偏才方案收藏、自适应调度三大机制
在MLE Bench数学基准测试中刷新7项Google AlphaEvolve纪录
模拟Kaggle竞赛获23枚金牌,迭代成功率稳定达100%
进化效率提升60%,关键指标如Correctness在Top-100迭代中平均达94%
全开源设计,支持开发者接入任务案例或构建垂直领域专家Agent
精华内容
传统智能体像高速运转却缺乏反思能力的机器,而LoongFlow让AI第一次拥有了可追溯、可优化的‘认知回路’——它不只输出答案,更记录自己为何走错、为何走对。
先想再做
PES(Plan-Execute-Self-reflect)范式要求智能体在行动前生成多维约束方案,在执行后自动触发深度复盘。实测显示,未采用该范式的基线模型在火山喷发预测任务中错误率高达78.3%,而加入PES后,同一任务下错误率降至0%,且复盘过程平均耗时仅1.2秒,不影响整体响应节奏。
这种机制并非简单增加后处理步骤,而是将反思嵌入推理链每个关键节点。例如在疫苗设计任务中,模型会主动比对生成序列与已知免疫原性数据库的匹配缺口,并据此修正下一轮采样分布。
PES使AI从‘试错驱动’转向‘归因驱动’,尤其在无标准答案的科研场景中,错误不再是终点,而是下一次迭代的输入参数。
建一座图书馆
混合进化记忆系统并非静态知识库,而是动态演化的方案策展平台。其中MAP-Elites模块对每份中间方案按‘效率-简洁度-鲁棒性’三维打分,即使某次尝试整体失败,只要在任一维度得分超阈值(如代码行数减少37%但准确率下降<2%),即被存入‘偏才档案’。
平行探索机制启用5个隔离计算岛同步演化,各岛采用不同突变策略(如梯度扰动强度差异达±40%),实测发现跨岛方案迁移使最优解发现速度提升2.3倍。
自适应调度器依据当前任务收敛曲线实时切换模式:当连续3轮Correctness提升<0.5%,自动从‘精细调优’切至‘广域探索’,避免陷入局部最优。
硬指标验证
在MLE Bench数学基准测试中,LoongFlow在7个子任务上超越Google AlphaEvolve最高分,其中‘鲸类识别挑战赛’准确率提升至99.2%,较前代高2.7个百分点;‘透明导体预测’任务推理延迟降低41%,同时保持100%正确率。
模拟Kaggle竞赛的23场测试覆盖图像分类、时序预测、文本检测等8类任务,金牌率100%,平均单任务训练周期缩短至4.8小时(基线为12.3小时)。
更关键的是稳定性:在1000次迭代压力测试中,Correctness标准差仅为1.2%,远低于基线模型的8.9%,证明其进化路径具备强可复现性。
LoongFlow的价值不在于替代人类科学家,而在于将AI从执行者升级为协作者——它让机器开始理解‘为什么错’,并系统性积累‘怎么改’的经验。当复盘成为默认动作,进化便有了方向。下一个问题是:当AI能自主优化解题路径,人类科研者的角色边界,是否需要重新定义?