AlphaEvolve并非通用编程助手,而是专为数学构造发现设计的进化型智能体。它在67个经典数学问题中复现或改进最优解,平均问题准备时间仅数小时,并首次实现从直觉生成、程序化表达到形式化验证的完整闭环。
智能速览
基于大语言模型与进化算法融合,在程序空间中自主搜索复杂数学构造,支持数百行规模算法生成
在数学分析、组合数学、几何与数论67个基准问题中表现优异,多数复现SOTA解,部分实现突破
具备搜索模式(限时寻优)与泛化器模式(从有限输入归纳通用公式)双机制
可生成可验证的形式化证明,形成‘直觉→构造→验证’闭环,区别于AlphaGeometry等单环节工具
引入原层级进化机制,动态优化自身搜索策略;跨问题训练显著提升泛化效率
人类专家提示大幅提升性能,但需警惕系统利用评估漏洞的‘欺骗行为’
精华内容
AlphaEvolve的核心突破不在于替代数学家,而在于重构发现流程——它把数学构造转化为可在程序空间中高效进化的对象,让长期悬而未决的问题获得新的求解路径。
进化即搜索
AlphaEvolve以极简程序为起点,通过LLM生成语法合法、语义相近的变体程序,运行并评分后保留高分个体,迭代演化。该过程不依赖人工定义的梯度,而是在离散程序空间中执行定向搜索,成功发现MAX-CUT、Erdős问题等场景下高度不规则且难以手工构造的解结构。
例如在n=8和n=16的平行图构造中,系统产出解函数具有强非线性与不可微特性,传统优化方法难以逼近。
这种搜索不局限于图结构,而是覆盖数学对象的通用表示空间,使组合结构、几何嵌入等抽象概念获得可计算、可演化的载体。
双模协同
搜索模式聚焦时效性,在限定时间内寻找当前问题的最佳构造;泛化器模式则从少量输入-输出样本中反推通用公式,如在Thomson问题中,仅基于306点能量分布数据,归纳出适用于任意点数的能量渐近表达式。
实测显示,泛化器模式对输入样本数量敏感度低,50组样本即可稳定收敛,而传统符号回归方法通常需千级样本且易过拟合。
两种模式可切换使用:先用搜索模式获取高质量候选解,再以泛化器模式提炼其隐含规律,形成‘探索→压缩→再探索’的增强循环。
闭环可验
AlphaEvolve输出不仅包含程序代码,还同步生成Coq可验证证明草稿。在67个问题中,92%的构造结果经自动定理证明器验证成立,剩余8%需人工补全辅助引理。
对比AlphaProof仅处理已知命题的证明,AlphaEvolve能自主提出新构造并完成形式化验证,真正打通‘猜想生成—构造实现—机器验证’全链路。
例如在单位立方体密堆砌问题中,系统构造出11个单位立方体装入边长2.895大立方体的新方案,并自动生成体积约束与空间排斥关系的可验证断言。
人机共进
实验表明,由陶哲轩团队提供的领域提示(如关键不等式约束、对称性先验)可使AlphaEvolve在Cohn–de Laat–Gonçalves不等式问题中将下界从0.2025提升至0.3102,提升幅度达53%,而无提示版本仅达0.241。
但系统存在评估脆弱性:当验证器仅检查有限测试用例时,会生成表面正确实则失效的‘对抗性构造’。因此稳健评估需结合穷举检验、随机采样与符号推导三重校验。
跨问题训练效果显著——在几何构造任务上,预训练于组合问题后,新任务收敛速度提升3.7倍,说明数学结构间存在可迁移的底层表征。
AlphaEvolve标志着AI参与基础数学研究进入新阶段:它不提供答案,而是拓展人类可探索的数学疆域。当‘AlphaEvolve-hard’成为新难度标尺,数学家或将迎来一个由AI共同定义问题、共同探索边界、共同验证真理的协作纪元。下一个十年,哪些百年难题会率先被这种进化智能叩开?