张大妈

DeepMind新突破:AI开始自我进化算法

源自抖音:Qiuming

03-03 13:48

谷歌DeepMind的AlphaEvolve系统,正通过模拟自然选择,让AI自主进化出超越人类设计的博弈论算法。这项突破不仅标志着AI从执行者向发明者的角色转变,更揭示了人类直觉难以触及的全新算法设计范式,为解决复杂决策问题开辟了新路径。

DeepMind新突破:AI开始自我进化算法智能速览

  • AlphaEvolve将算法代码视为基因组,利用LLM进行变异和筛选。

  • 研究聚焦于博弈论两大核心算法家族CFR与PSRO。

  • 进化出的VAD-CFR算法采用反直觉规则,性能全面超越人类方案。

  • SHOR-PSRO算法通过差异化策略同样实现了性能碾压。

  • AI已从执行工具转变为能够自主发明算法的创造者。

DeepMind新突破:AI开始自我进化算法精华内容

AlphaEvolve的核心,是让算法像生物一样繁殖与淘汰。这一过程如何运作,又诞生了哪些颠覆性成果?

进化式编码

传统算法设计依赖人类专家的数学推导与直觉,而AlphaEvolve彻底颠覆了这一模式。它将算法的源代码视为可进化的「基因组」,并利用Gemini大语言模型充当「遗传算子」。Gemini能对代码进行智能变异,包括重写逻辑、注入新的控制流等,从而生成多样化的后代算法。随后,系统通过严格的性能评估来筛选「适应度」最高的个体,让其进入下一代迭代。这种「代码的自然选择」过程,将算法的搜索空间从人类直觉的有限范围,扩展到几乎无限的合理变体中。

聚焦博弈论

AlphaEvolve的研究目标明确,聚焦于多智能体强化学习的两大基石算法家族:反事实遗憾最小化(CFR)和策略空间响应预言(PSRO)。这两类算法是解决不完全信息博弈(如德州扑克AI)寻找纳什均衡的关键。其核心性能指标是「可利用度」,即衡量对手能够利用该算法策略的程度。可利用度越低,代表算法的策略越稳健、越难以被击败,达到了让对手无法占便宜的完美平衡点。

反直觉的VAD-CFR

AlphaEvolve进化出的VAD-CFR算法展现了惊人的创造力。它学会了三项完全反直觉的规则:当局势混乱时,它会果断遗忘旧经验;当发现有利策略时,它会加倍强化学习;在训练的前500轮,它只专注学习而不做总结。这套在人类看来颇为「怪异」的规则组合,在所有测试的博弈场景中,其可利用度均显著低于人类设计的经典CFR算法,表现最佳。

差异化的SHOR-PSRO

另一项成果SHOR-PSRO算法同样出色,它采取了「前期大胆试探,后期精准收网」的策略。该算法的创新之处在于,训练阶段与测试阶段采用了完全不同的方案。在训练初期,它大胆探索各种策略可能性;到了后期,则切换到一种更精确、更稳健的求解模式。这种动态调整的差异化策略,使其性能同样碾压了人类设计的传统PSRO方案。

范式之变

论文作者指出:「自动发现的算法不对称性,特别是那些管理遗憾缩放和动态混合调制的机制,能够产生人类直觉难以捉摸、但实践中极其有效的求解器。」这标志着AI的角色发生了根本性转变:它已不再是执行人类指令的工具,而是开始成为一个能够自己发明数学、创造算法的独立「发明家」。DeepMind计划将这一进化框架拓展到深度强化学习智能体的完整设计,以及合作博弈中的机制发现。

AlphaEvolve的成功,预示着一个算法设计新纪元的到来。当AI能够探索超越人类认知的解决方案,未来的科学发现与技术创新将迎来怎样的变革?代码的「自然选择」无疑才刚刚拉开序幕。

精选参考来源

DeepMind再突破!AlphaEvolve用「进化」造出 DeepMind再突破!AlphaEvolve用「进化」造出超越人类智慧的算法 谷歌DeepMind近日发布重磅研究成果:利用全新AI系统AlphaEvolve,通过「自然选择」机制成功进化出全新的博弈论算法。这些由AI「繁殖」出的算法不仅在性能上全面超越人类数十年设计的经典方案,更令人震惊的是——它们采用了人类研究者从未想过的反直觉机制。 核心突破:让算法像生物一样进化 传统方法中,算法依赖人类专家的直觉设计和数学推导。而AlphaEvolve彻底颠覆了这一模式: 它将算法源代码视为可进化的「基因组」 让Gemini大语言模型充当「遗传算子」,对代码进行智能变异 通过性能评估筛选「适应度」最高的算法 经过多代进化,最终诞生出性能最优的新算法 目标领域:博弈论两大核心算法 研究聚焦于多智能体强化学习的两个基石算法家族——反事实遗憾最小化(CFR)和策略空间响应预言(PSRO)。这两类算法是不完全信息博弈(如德州扑克AI)寻找纳什均衡的关键,其核心指标「可利用度」要求算法达到对手无法占便宜的完美平衡点。 两大突破性成果 VAD-CFR算法:学会了三项反直觉规则——局势混乱时果断遗忘旧经验、发现有利策略时加倍强化、前500轮专注学习不做总结。这套「怪异」规则却在所有测试博弈中表现最佳。 SHOR-PSRO算法:采取「前期大胆试探,后期精准收网」的策略,训练与测试使用差异化方案,同样碾压人类设计的传统方案。 范式转变:AI从执行者变为发明者 论文作者指出:「自动发现的算法不对称性——特别是那些管理遗憾缩放和动态混合调制的机制——能够产生人类直觉难以捉摸、但实践中极其有效的求解器。」 这意味着AI已不再只是执行人类指令的工具,而是开始自己发明数学、创造算法。DeepMind计划将这一进化框架拓展到深度强化学习智能体的完整设计,以及合作博弈中的机制发现。 代码的「自然选择」,才刚刚开始。https://x.com/rryssf_/status/2027062703144284521
内容由AI生成

精选参考来源

DeepMind再突破!AlphaEvolve用「进化」造出 DeepMind再突破!AlphaEvolve用「进化」造出超越人类智慧的算法 谷歌DeepMind近日发布重磅研究成果:利用全新AI系统AlphaEvolve,通过「自然选择」机制成功进化出全新的博弈论算法。这些由AI「繁殖」出的算法不仅在性能上全面超越人类数十年设计的经典方案,更令人震惊的是——它们采用了人类研究者从未想过的反直觉机制。 核心突破:让算法像生物一样进化 传统方法中,算法依赖人类专家的直觉设计和数学推导。而AlphaEvolve彻底颠覆了这一模式: 它将算法源代码视为可进化的「基因组」 让Gemini大语言模型充当「遗传算子」,对代码进行智能变异 通过性能评估筛选「适应度」最高的算法 经过多代进化,最终诞生出性能最优的新算法 目标领域:博弈论两大核心算法 研究聚焦于多智能体强化学习的两个基石算法家族——反事实遗憾最小化(CFR)和策略空间响应预言(PSRO)。这两类算法是不完全信息博弈(如德州扑克AI)寻找纳什均衡的关键,其核心指标「可利用度」要求算法达到对手无法占便宜的完美平衡点。 两大突破性成果 VAD-CFR算法:学会了三项反直觉规则——局势混乱时果断遗忘旧经验、发现有利策略时加倍强化、前500轮专注学习不做总结。这套「怪异」规则却在所有测试博弈中表现最佳。 SHOR-PSRO算法:采取「前期大胆试探,后期精准收网」的策略,训练与测试使用差异化方案,同样碾压人类设计的传统方案。 范式转变:AI从执行者变为发明者 论文作者指出:「自动发现的算法不对称性——特别是那些管理遗憾缩放和动态混合调制的机制——能够产生人类直觉难以捉摸、但实践中极其有效的求解器。」 这意味着AI已不再只是执行人类指令的工具,而是开始自己发明数学、创造算法。DeepMind计划将这一进化框架拓展到深度强化学习智能体的完整设计,以及合作博弈中的机制发现。 代码的「自然选择」,才刚刚开始。https://x.com/rryssf_/status/2027062703144284521

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章