谷歌DeepMind的AlphaEvolve系统,正通过模拟自然选择,让AI自主进化出超越人类设计的博弈论算法。这项突破不仅标志着AI从执行者向发明者的角色转变,更揭示了人类直觉难以触及的全新算法设计范式,为解决复杂决策问题开辟了新路径。
智能速览
AlphaEvolve将算法代码视为基因组,利用LLM进行变异和筛选。
研究聚焦于博弈论两大核心算法家族CFR与PSRO。
进化出的VAD-CFR算法采用反直觉规则,性能全面超越人类方案。
SHOR-PSRO算法通过差异化策略同样实现了性能碾压。
AI已从执行工具转变为能够自主发明算法的创造者。
精华内容
AlphaEvolve的核心,是让算法像生物一样繁殖与淘汰。这一过程如何运作,又诞生了哪些颠覆性成果?
进化式编码
传统算法设计依赖人类专家的数学推导与直觉,而AlphaEvolve彻底颠覆了这一模式。它将算法的源代码视为可进化的「基因组」,并利用Gemini大语言模型充当「遗传算子」。Gemini能对代码进行智能变异,包括重写逻辑、注入新的控制流等,从而生成多样化的后代算法。随后,系统通过严格的性能评估来筛选「适应度」最高的个体,让其进入下一代迭代。这种「代码的自然选择」过程,将算法的搜索空间从人类直觉的有限范围,扩展到几乎无限的合理变体中。
聚焦博弈论
AlphaEvolve的研究目标明确,聚焦于多智能体强化学习的两大基石算法家族:反事实遗憾最小化(CFR)和策略空间响应预言(PSRO)。这两类算法是解决不完全信息博弈(如德州扑克AI)寻找纳什均衡的关键。其核心性能指标是「可利用度」,即衡量对手能够利用该算法策略的程度。可利用度越低,代表算法的策略越稳健、越难以被击败,达到了让对手无法占便宜的完美平衡点。
反直觉的VAD-CFR
AlphaEvolve进化出的VAD-CFR算法展现了惊人的创造力。它学会了三项完全反直觉的规则:当局势混乱时,它会果断遗忘旧经验;当发现有利策略时,它会加倍强化学习;在训练的前500轮,它只专注学习而不做总结。这套在人类看来颇为「怪异」的规则组合,在所有测试的博弈场景中,其可利用度均显著低于人类设计的经典CFR算法,表现最佳。
差异化的SHOR-PSRO
另一项成果SHOR-PSRO算法同样出色,它采取了「前期大胆试探,后期精准收网」的策略。该算法的创新之处在于,训练阶段与测试阶段采用了完全不同的方案。在训练初期,它大胆探索各种策略可能性;到了后期,则切换到一种更精确、更稳健的求解模式。这种动态调整的差异化策略,使其性能同样碾压了人类设计的传统PSRO方案。
范式之变
论文作者指出:「自动发现的算法不对称性,特别是那些管理遗憾缩放和动态混合调制的机制,能够产生人类直觉难以捉摸、但实践中极其有效的求解器。」这标志着AI的角色发生了根本性转变:它已不再是执行人类指令的工具,而是开始成为一个能够自己发明数学、创造算法的独立「发明家」。DeepMind计划将这一进化框架拓展到深度强化学习智能体的完整设计,以及合作博弈中的机制发现。
AlphaEvolve的成功,预示着一个算法设计新纪元的到来。当AI能够探索超越人类认知的解决方案,未来的科学发现与技术创新将迎来怎样的变革?代码的「自然选择」无疑才刚刚拉开序幕。