过去一年,大型语言模型处理高中及以上难度数学问题的能力实现了飞速进步。人工智能正在逼近人类数学家吗?
作者:威尔・道格拉斯・黑文
存档页面发布时间:2025 年 6 月 4 日

配图拼合内容:破损的方格纸、电路图案、科研人员与数学公式。
艾达・阿梅尔 / 麻省理工科技评论 | 图片来源:Adobe
《麻省理工科技评论》的 “未来展望” 系列将跨行业、跨趋势、跨技术,为你率先呈现未来图景。你可以点击此处查看系列其他内容。
在美国国防高级研究计划局(DARPA)看来,数学研究仍停留在旧模式。今年 4 月,美国国防部下属的 DARPA 启动了一项全新计划expMath(全称 Exponentiating Mathematics,即 “指数级发展数学”),该机构希望借此加速数学领域的研究突破 —— 数学是计算机科学、医学、国家安全等诸多关键现实应用的基石。
DARPA 项目主管帕特里克・沙夫托在介绍该计划的视频中表示:“数学是产生巨大影响力的源头,但数百年来,其研究方式几乎一成不变 —— 都是人们站在黑板前推导。”
相关报道

围绕眼镜标识的大 O 符号公式
谷歌深度思维推出新型 AI 智能体,解决现实问题的能力超越人类
现代世界建立在数学之上。数学让我们能够模拟复杂系统,比如飞机周围的气流、金融市场的波动、血液在心脏中的流动。而高等数学的突破,还能解锁加密技术、数据压缩等新技术 —— 加密技术是私密通讯和网上银行的核心,数据压缩则让我们能在互联网上传输图像和视频。
但数学领域的突破往往需要数年时间。DARPA 希望加快这一进程。expMath 计划的目标,是推动数学家与人工智能研究人员共同开发 DARPA 所称的AI 合著者—— 这一工具可将庞大、复杂的数学问题拆解为更易理解、理论上也能更快解决的小型简单问题。
数十年来,数学家一直借助计算机加速计算或验证数学命题的真伪。而新的愿景是,人工智能或许能帮助攻克此前无法解决的难题。
不过,能解决高中阶段数学问题的人工智能(新一代模型已掌握这一能力),与(理论上)能解决职业数学家毕生钻研难题的人工智能之间,存在着巨大差距。
前者是能够自动化部分数学研究生日常工作的工具,后者则是可能推动人类知识突破现有边界的工具。
我们可以从三个维度看待这一差距:
1/ 人工智能需要的不止是解题巧思
大型语言模型并非以数学见长,它们容易编造答案,甚至会得出 “2+2=5” 这样的错误结论。但该技术的新版本,尤其是 OpenAI 的 o3、Anthropic 的 Claude 4 Thinking 等大推理模型(LRMs),能力已大幅提升 —— 这也让数学家们倍感振奋。
今年,多款大推理模型尝试通过分步推理而非直接给出答案来解题,它们在 美国数学邀请赛(AIME) 中取得了高分。AIME 是面向美国高中数学成绩前 5% 学生的竞赛。
与此同时,少数将大型语言模型与事实核查系统结合的新型混合模型也实现了突破。巴西圣保罗大学数学家艾米莉・德奥利韦拉・桑托斯指出,谷歌深度思维的AlphaProof就是关键里程碑之一 —— 该系统将大型语言模型与深度思维的博弈模型 AlphaZero 相结合。去年,AlphaProof 成为首个在国际数学奥林匹克竞赛中达到银牌选手水平的计算机程序,而这是全球最具声望的数学赛事之一。
今年 5 月,谷歌深度思维推出的AlphaEvolve模型,针对 50 余道未解决的数学谜题及多个现实计算机科学问题,得出了比人类现有成果更优的解法。
技术进步的趋势十分明显。德奥利韦拉・桑托斯表示:“GPT-4 几乎无法处理本科以上难度的数学问题。我记得它发布时,我用一道拓扑学题目测试它,它写不了几行就彻底跑偏。” 但当她将同一道题目交给 OpenAI 今年 1 月发布的大推理模型 o1 时,模型完美解答了问题。
这是否意味着这类模型已能胜任 DARPA 期望的合著者角色?桑托斯认为未必:“奥数题往往需要运用巧妙的解题技巧,而研究类问题更具探索性,涉及的变量也多得多。” 在某类解题场景中取得成功,未必能迁移到另一类场景。
其他专家也持相同观点。牛津大学数学家马丁・布里德森认为,人工智能在奥数竞赛中的表现是一项重大成就,但 “并不令人震撼”。他表示:“这并非‘天哪,我以为机器永远做不到’的范式突破,我本就预料到机器能做到这一点。”
原因在于,尽管奥数及 AIME 等高中、本科难度竞赛的题目难度较高,但其中很多题目都有规律可循。布里德森说:“我们会开设训练营训练高中生解题。既然能训练大量人掌握这些题目,为什么不能训练机器呢?”
加州理工学院数学家谢尔盖・古科夫曾担任奥数队教练,他指出,赛事中的题型变化并不大。每年虽会推出新题,但解题思路万变不离其宗。
古科夫说:“当然,具体题目从未出现过,但它们与我们见过的无数题目高度相似,只是多了一步。你立刻会发现,‘天哪,相似度太高了 —— 我可以用同样的策略解题’。” 竞赛级数学虽难,但无论是孩子还是机器,都能通过训练掌握解题方法。
相关报道
与电路板融合的人物剪影,电路板上印有拉文图形测试图
人工智能的炒作建立在高分之上。这些测试存在缺陷。
但大多数未解决的数学问题并非如此。布里德森是美国克莱数学研究所的所长 —— 该非营利机构因 2000 年设立千禧年大奖难题而闻名,这七大数学领域最核心的未解难题,每道题的首位解决者将获得 100 万美元奖金。(其中庞加莱猜想已于 2010 年被解决,其余如 P vs NP 问题、黎曼猜想等仍未破解。)布里德森表示:“人工智能要对这些难题做出有价值的研究,还相距甚远。”
然而,确切的差距难以衡量,因为许多用于评估人工智能进步的现有基准已接近上限。目前最先进的模型在 AIME 等测试中的表现,已优于绝大多数人类。
为更清晰地了解现有系统的能力边界,一家名为 Epoch AI 的初创公司于去年 12 月推出了全新测试FrontierMath。该测试并未沿用为人类设计的数学试题,而是联合全球 60 余名数学家从零研发。
FrontierMath 旨在探究当前人工智能的能力极限。所有题目均为原创,且大部分题目对外保密,避免被纳入训练数据。每道题都需要专家数学家耗费数小时才能解答 —— 部分题目甚至需要专业知识才能攻克。
FrontierMath 有望成为行业标准。参与部分题目研发的德奥利韦拉・桑托斯表示,该测试目前的知名度不及 AIME,但 “这种情况不会持续太久,因为现有基准已接近饱和”。
在 AIME 测试中,表现最优异的大型语言模型(Anthropic 的 Claude 4、OpenAI 的 o3 和 o4-mini、谷歌深度思维的 Gemini 2.5 Pro、X-AI 的 Grok 3)得分约为 90%;而在 FrontierMath 测试中,o4-mini 仅得 19%,Gemini 2.5 Pro 得 13%。这一成绩依然亮眼,但显然仍有巨大提升空间。
FrontierMath 将最直观地展现人工智能在数学领域的进步速度,但仍有不少难题是目前计算机难以攻克的。
2/ 人工智能需要处理极长的推理步骤
仔细观察不难发现,数学问题在某种程度上具有共性:解题都需要从起点到终点完成一系列推理步骤。难点在于找到这些步骤。
古科夫表示:“几乎所有数学问题都可以被转化为路径寻找问题。” 而题目难度的差异,核心在于推理步骤的数量。“黎曼猜想与高中数学的区别在于,高中数学的解题路径很短 —— 通常 10 步、20 步,最长也不过 40 步。且不同题目间的步骤具有重复性。”
“但要解决黎曼猜想,我们尚无明确路径,我们要寻找的是一条极长的路径 —— 古科夫称,这可能需要百万行计算机证明。”
寻找极长的推理步骤,可被视为一种复杂的博弈。深度思维的 AlphaZero 正是通过这种方式掌握了围棋和国际象棋。一局围棋仅有数百步,但 AI 必须在海量可能的走法中找到获胜序列。古科夫举例,想象一个末尾有 100 个零的数字。
但这与证明或推翻极难数学问题所需的可能推理序列相比,微不足道。古科夫说:“包含 1000 步或 100 万步的证明路径,对应的数字会有 1000 个或 100 万个零。”
目前没有任何人工智能系统能筛选如此庞大的可能性。为解决这一问题,古科夫及其团队研发了一套系统,通过将多个步骤合并为超级步骤来缩短路径长度。这就像穿上了能大步前行的鞋子:原本走一英里需要 2000 步,现在只需 20 步。
挑战在于确定哪些步骤可以合并为超级步骤。在一系列实验中,研究人员开发了一套系统:一个强化学习模型提出新步骤,另一个模型验证这些步骤是否有效。
他们利用这一方法,在 安德鲁斯 - 柯蒂斯猜想(AC 猜想) 这一 60 年未解的数学难题上取得了突破。古科夫表示,这是每位职业数学家都熟知的问题。
数学爱好者专属补充
AC 猜想指出,描述一类名为平凡群的集合的特定方式,可通过一系列步骤转化为另一种等价描述。大多数数学家认为 AC 猜想不成立,但无人能证明。古科夫坦言,这是一项纯学术的趣味难题,却对数学家而言意义重大。
古科夫及其团队并未彻底解决 AC 猜想,但他们证实,40 年前提出的一个反例(用以证明猜想不成立)本身是错误的。古科夫说:“这一方向是过去 40 年的主要研究路径,而借助人工智能,我们证明了此路不通。”
布里德森表示:“排除可能的反例是极具价值的事。它能帮我们避开死胡同,避免耗费一年时间在错误方向上探索。”
诚然,古科夫仅解开了一道深奥难题的一个分支,但他认为,这一方法适用于所有需要寻找极长未知步骤的场景,目前他计划将其应用于其他难题。
古科夫说:“这或许会推动人工智能整体技术的进步。因为它让强化学习模型突破了训练边界。对我而言,这本质上是跳出思维定式 —— 距离现有范式非常遥远。”
3/ 人工智能能否产生真正的数学洞见?
跳出思维定式,正是数学家攻克难题的关键。数学常被认为是机械的分步推导,但高等数学实则是一门实验性学科,包含试错与灵感迸发。
相关报道
在彩色派对灯光下站在桌前的人,身后是电脑显示屏
人工智能如何助力创造力爆发?
AlphaEvolve等工具正是在此领域发挥作用。谷歌深度思维的最新模型让大型语言模型生成代码以解决特定数学问题,再由另一个模型评估这些解法、筛选最优结果并反馈给大型语言模型进行优化。经过数百轮试错,AlphaEvolve 针对各类数学问题得出的解法,优于人类现有成果。它也可作为协作工具:在任意步骤中,人类可将自身洞见分享给大型语言模型,给出具体指令。
这种探索式研究是高等数学的核心。澳大利亚悉尼大学数学家乔迪・威廉姆森说:“我常寻找有趣的现象,朝着某个方向探索。比如,‘我沿着这条小径看看,哦,发现新东西了!’”
威廉姆森与元宇宙公司合作研发了PatternBoost人工智能工具,专为支持这类探索而设计。该工具可基于某个数学概念或命题,生成相似的概念与命题。威廉姆森说:“它的作用就像,‘给我一堆有趣的东西,我也不知道其中规律,但你能生成更多类似的内容吗?’”
这种头脑风暴是数学研究的关键,也是新思想的诞生方式。威廉姆森以正二十面体为例:“这是我在研究中反复提及的绝佳案例。” 正二十面体是一种 20 面的三维物体,每个面均为三角形(类似 20 面骰子)。它是一类仅有五种的正多面体中体积最大的 —— 其余四种分别是正四面体(4 面)、正方体(6 面)、正八面体(8 面)、正十二面体(12 面)。
值得注意的是,古希腊数学家早已证明这类正多面体仅有五种。威廉姆森说:“该定理被证明时,正二十面体并非实体存在。你无法在采石场找到它,它是人类在脑海中发现的。而正二十面体对数学产生了深远影响,至今仍以极其深刻的方式影响着我们。”
在威廉姆森看来,PatternBoost 等工具的潜力,是帮助人类发现未来的正二十面体这类数学对象,进而重塑数学的发展方向。但目前这一目标尚未实现。他说:“人工智能已能为研究级数学问题做出有价值的贡献,但现阶段,我们还不会迎来海量新定理的爆发。”
归根结底,机器仍缺乏人类所谓的直觉与创造性思维。威廉姆森总结道:如今的人工智能,在掌握游戏规则后能击败人类。“但计算机达到超人类水平的围棋水平,与发明围棋,是两码事。”
“这一逻辑也适用于高等数学。突破源于对事物全新的思考方式,就像在博弈中发现全新的走法。而我认为,我们尚未真正理解,深层数学中这些绝妙的思路从何而来。”
或许,AlphaEvolve、PatternBoost 这类人工智能工具,更适合被视为人类直觉的先锋侦察兵。它们能探索新方向、指出死胡同,为数学家节省数月甚至数年的研究时间。但真正的突破,仍将源自人类的智慧 —— 数千年来皆是如此。
至少目前如此。威廉姆森说:“众多科技公司都认为这种情况不会持续太久,但我们拭目以待。”

What’s next for AI and math | MIT Technology Review
https://www.technologyreview.com/2025/06/04/1117753/whats-next-for-ai-and-math/