大规模数学发现时代开启!陶哲轩论文探讨顶尖数学家与顶级AI之间深刻的协同探索

2021年12月,DeepMind与数学家合作发现扭结理论中的新结构。

2022年10月,AlphaTensor发现更快的矩阵乘法算法。

近两年各种AI数学研究系统正在变得越来越强,AI辅助数学发现正在加速。

刚刚,一篇论文预印本出现在arXiv上,标题是《Mathematical Exploration and Discovery at Scale》(大规模的数学探索与发现)。

论文中有四十多个章节探讨了AI辅助数学研究的各种案例。数学专业的朋友一定要读读原文。

作者名单中,一个名字尤为引人注目:陶哲轩。

与他并列的,是来自谷歌DeepMind的研究团队。这篇论文揭示了顶尖数学家与顶级人工智能之间一次深刻的协同探索,其核心是谷歌AlphaEvolve系统。

这个由大语言模型驱动的进化智能体,不仅在67个数学问题上取得了惊人成果,更预示着一个数学研究新范式的到来。

陶哲轩,这位当代最具影响力的数学家,几乎是天才的代名词。

13岁摘得国际数学奥林匹克竞赛金牌,24岁成为加州大学洛杉矶分校史上最年轻的终身教授,31岁荣获数学界的最高荣誉菲尔兹奖。

他的研究横跨调和分析、偏微分方程、组合数学等多个领域,解决了诸多悬而未决的难题。

当这样一位人类智慧的巅峰代表,选择与AI深度合作,其本身就传递出一个强烈的信号:数学的未来,正在被重新定义。

AI进化出的数学新直觉

AlphaEvolve并非传统的优化工具。它不做数值上的微调,而是直接进化计算机代码本身。

想象一个由代码组成的生物种群。

AlphaEvolve的工作机制便是这个种群的进化引擎,它由两个核心部件驱动。

一个是生成器。它本质上是一个大型语言模型,扮演着引入变异的角色。

它会从当前种群中挑选出表现优异的代码程序,然后对它们进行突变,创造出新的候选方案。

这种突变不是随机的字符替换,而是智能的、理解语法的代码修改,它会学习父代程序的逻辑,甚至能理解人类专家在提示中给出的建议。

这个过程可以在成千上万的CPU上并行展开,瞬间产生海量的可能性。

另一个是评估器。这是进化的自然选择法则,通常由人类研究者根据具体问题来设定。

它是一段确定性的代码,会运行种群中的每一个程序,并根据其表现给出一个量化的分数。在数学构造问题中,这个分数可能是一个图的边数,或是一个几何包装的密度。

整个过程从几个简单的初始程序开始。

每一代,得分最高的程序被选中,送入生成器进行突变,产生新的后代。

后代们再被评估、打分,优胜劣汰。这个生成与选择的循环不断重复,驱动着整个代码种群朝着能产生更高质量解的方向持续进化。

AlphaEvolve是DeepMind早期系统FunSearch的一次重大升级。

FunSearch首次证明了大型语言模型可以生成函数代码来帮助发现新的科学知识,但它的能力局限于进化单个、十几行的Python函数。

AlphaEvolve则实现了质的飞跃,它能进化整个代码文件,处理包含数百行代码、用任何编程语言写成的复杂算法。

能力的跃升是全方位的。

AlphaEvolve只需要数千次模型调用就能取得成果,而FunSearch需要数百万次。

它能充分利用最先进大型语言模型的强大能力,并能理解人类在提示中提供的丰富上下文和反馈。这让它不再是一个简单的函数发现器,而是一个能够与人类专家对话、共同开发复杂算法的合作伙伴。

AI在67个数学难题上交出答卷

陶哲轩与DeepMind团队将AlphaEvolve应用于67个横跨数学分析、组合数学、几何学和数论的开放问题。这些问题大多可以被表述为寻找某个数值量的上界或下界。

结果令人印象深刻。

在约75%的问题上,系统独立地重新发现了当前已知的最佳解决方案。

这些方案很多是数学家们经过几十年努力才找到的,有些甚至被推测为理论最优解。AlphaEvolve不仅找到了结果,还经常给出了具有可解释性的构造过程。

在约20%的问题上,AlphaEvolve超越了人类,发现了新的、可被证明优于当前最先进水平的构造。

更令人惊讶的是,在某些问题上,AlphaEvolve能够将有限输入值下的结果,推广为适用于所有输入值的通用公式。这种从特例中发现通则的能力,已经触及了数学发现的核心。

在有限域几何中,Kakeya集和Nikodym集是重要的研究对象。

AlphaEvolve针对这个问题发现了一种有趣的通用构造。当这个代码化的解决方案被交给另一个名为Deep Think的AI智能体时,后者成功地推导出了其正确性证明,并给出了其大小的闭式公式。

随后,这个证明又被AI工具AlphaProof在Lean证明助手中进行了完全的形式化验证。

这个工作流——AlphaEvolve发现模式,Deep Think生成符号证明,AlphaProof进行形式验证——清晰地展示了未来数学研究的一种可能路径。

AI工具链的组合,有望将从经验观察到形式化数学定理的过程,实现自动化或半自动化。

矩阵乘法是算法设计的基石。1969年,Strassen提出了一种比传统算法更快的矩阵乘法方法,这一算法在随后的半个多世纪里一直是4×4复值矩阵乘法的最优解。

AlphaEvolve向这个经典问题发起了挑战,最终发现了一种仅需48次乘法即可完成计算的算法,改进了施特拉森的纪录。

这是56年来人类首次在该问题上取得突破,彰显了AlphaEvolve在算法发现领域的强大实力。

几何学中的接触数(Kissing Number)问题,三百年来吸引了无数数学家的目光。

它问的是,在一个特定维度下,最多有多少个互不重叠的单位球体可以同时接触一个中心单位球体。在11维空间中,AlphaEvolve发现了一个包含593个外球体的构型,刷新了已知的下界纪录。

在与算术Kakeya猜想相关的和差指数问题上,AlphaEvolve最初基于离散高斯函数提出了一些候选解。

这些解虽然不是精确的极值函数,但已经足以对文献中已知的下限做出微小改进。

陶哲轩受到这个结果的启发,后续从理论上严格获得了一些关于这些指数在特定情况下的渐近行为的新结果。AI的探索,即使不完美,也为人类数学家提供了宝贵的灵感和方向。

AI探索数学的两种模式

为了应对不同类型的数学问题,AlphaEvolve演化出了两种截然不同的工作模式:搜索模式与泛化模式。

搜索模式极具巧思。在这种模式下,AlphaEvolve进化的程序本身不是一个最终的数学构造,而是一个用于寻找这个构造的启发式搜索算法。

评估器会给这些进化出的搜索算法一个固定的时间预算,比如100秒,然后评判谁能在这段时间内找到最好的构造。

这种方法巧妙地解决了计算速度的矛盾。生成一个新的搜索启发式,可能需要一次相对缓慢的大模型调用,但这个启发式一旦诞生,就可以在廉价的计算资源上疯狂运行,自行探索数百万甚至数十亿个候选构造。

陶哲轩对此解释道,搜索不必每次都从零开始。

新的启发式算法会根据其改进当前已知最佳构造的能力来获得评分。

因此,系统实际上是在进化一群改进者函数。这创造了一个动态且自适应的搜索过程。

在初期,擅长进行广泛探索的启发式会受到青睐;当接近一个优秀解时,那些擅长进行精细局部优化的启发式可能会接管。最终的产物,往往是一系列专门的启发式算法,它们环环相扣,共同导出了最先进的构造。

泛化模式则更为雄心勃勃。研究团队不再要求AlphaEvolve为某个固定的问题规模(比如11维的接触数)寻找解,而是要求它编写一个能解决任意给定规模n的问题的通用程序。

评估器会根据这个程序在一系列不同的n值上的综合表现来打分。

其背后的期望是,通过观察自己为较小的n找到的最优解,AlphaEvolve或许能发现其中的规律,并将其推广为一个适用于所有n的通用构造。

这种模式的挑战性要大得多,但也产出了一些最激动人心的结果。

前面提到的Nikodym集问题的构造,正是在泛化模式下被发现的,并直接启发了一篇新的数学论文。

虽然在搜索模式下进化出的程序本身难以被人类理解,但它找到的最终构造依然可以被分析,并同样为人类数学家带来了新的研究灵感。

人类顶尖数学家与AI协同的新范式

陶哲轩在他的社交媒体上明确表示,他一直在与谷歌DeepMind的团队合作,探索AlphaEvolve在数学领域的应用。这次合作并非简单地把AI当作一个计算工具,而是一种深度的人机协同新范式。

陶哲轩反复强调,将人类的专业知识与AlphaEvolve的计算能力相结合,才能产生最佳结果。

在特定问题专家手中的AlphaEvolve,总是比非专家用户使用时表现得好得多,他写道,我们在提示中给予AlphaEvolve的建议,对最终构造的质量有显著影响。一个富有洞察力的专家建议,几乎总能带来更好的结果。

这说明,AI并非要取代数学家,而是要成为他们的增强器。

AI负责提供强大的搜索和模式发现能力,而人类专家则负责提供高层次的直觉、方向性的指导和对结果的最终判断。两者的结合,才构成了最强大的研究力量。

当然,AlphaEvolve也并非完美。陶哲轩客观地分析了它的优势与局限。

它的优势在于规模,可以系统性地研究一大类问题,而设置一个新问题的准备时间通常只需要几个小时,远低于传统数学研究。

它的鲁棒性也很好,不需要为每个问题进行大量的参数调优。

更重要的是,它提供的许多解决方案具有可解释性,其输出的代码可以直接被人类阅读和理解,从而获得关于解的性质的洞察。

局限性同样明显。AlphaEvolve非常擅长利用评估代码中的漏洞,找到一些技术上得分很高但不符合问题精神的退化解。

对于那些在训练数据中非常知名的问题,它几乎可以瞬间回忆起最优解,研究人员必须刻意模糊问题才能让它进行真正的探索。

而对于像西多连科猜想、森多夫猜想这类著名的开放猜想,AlphaEvolve虽然能找到已知的极值候选,但未能发现更强的反例,从而推翻这些猜想。

在技术层面,研究团队也对AlphaEvolve的性能进行了细致分析。

他们发现,增加并行计算的线程数可以显著加快发现速度,但总的计算成本也会相应增加。这揭示了速度与成本之间的权衡:快速探索需要高并行度,而节约成本则需要用更少线程进行更长时间的运行。

模型选择也至关重要。更强大、更昂贵的LLM通常能产生更高质量的建议,用更少的进化步骤达到更好的分数。

但最有效的策略并非总是使用最强的模型。对于一些相对简单的问题,用廉价模型进行大量尝试,反而是成本效益最高的方案。有时,廉价模型带来的天真创造力和多样性,反而能帮助系统跳出局部最优。

这表明,在进化过程中注入一定的随机性和多样性,可能是有益的。

除了纯数学,AlphaEvolve的能力已经延伸到实际工程问题中。

它为谷歌的数据中心调度系统Borg发现了一个简单而高效的启发式算法,持续为谷歌全球计算资源恢复了0.7%的平均效率,这个方案已在生产环境中稳定运行超过一年。

它还为谷歌的下一代张量处理单元(TPU)硬件设计提供了优化建议,并加速了Gemini大模型的训练,将一个关键计算内核的速度提升了23%,使整体训练时间减少了1%。

这些应用证明,AlphaEvolve不仅是数学家的思想伙伴,也是工程师的得力助手。

这次合作的意义,远超发现几个新的数学构造。它揭示了数学家角色可能的转变。

在未来,数学家可能会更多地扮演指导者和验证者的角色,利用AI工具探索假设,尝试解决问题的新路径,并快速完成证明中繁琐的部分。

陶哲轩设想,未来可以系统性地用这类工具来评估数学猜想的难度。

研究人员或许可以半自动地将某些不等式标记为AlphaEvolve-hard,意味着它们难以用当前的AI方法攻克,而另一些问题则可以被标记为适合进一步的计算机辅助研究,从而更有效地指导人类的智力投入。

一个由AI驱动的数学发现时代正在拉开序幕。

陶哲轩与DeepMind的合作,正是这一新时代的序章。

参考资料:

https://arxiv.org/abs/2511.02864

https://www.math.ucla.edu/~tao

https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms

https://deepmind.google/discover/blog/ai-solves-imo-problems-at-silver-medal-level

https://blog.google/technology/google-deepmind/ai-for-math/

https://www.nature.com/articles/s41586-022-05172-4

https://www.nature.com/articles/s41586-021-04086-x

END

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询