可预见的短期内,AI 在数学研究中最具生产力的应用场景,并不主要来自“用最强大的模型去硬啃最难的问题”。当然,这样的突破偶尔也会出现,尤其是在投入了大量算力和顶尖专家精力的情况下。但更普遍、也更现实的价值,来自另一条路径:
用“中等能力”的 AI 工具,加速和规模化那些看似普通、却极其耗时、而且不可或缺的研究工作。
这些工作本身,人类专家完全可以完成,只是需要花费大量时间和精力。正因为如此,AI 在这里反而更容易被安全、可靠地使用——我们可以用人类长期积累的经验来指导、校验并消化 AI 的输出,把它自然地嵌入到现有的研究流程中。
从这个角度看,AI 能做的事情“人类也能做”并不是缺陷,而是优点。因为这意味着:
AI 给出的结果可以被专家快速评估、确认真伪,并转换成研究者早已熟悉、信任的工作形式。
一个非常典型、但又极其重要的“日常型任务”,就是文献综述(literature review):为某个研究问题找到所有相关的已有研究。
如果一个问题已经有了公认的名称,也有一个成熟的研究社群在长期关注它,那么事情其实并不难。现有的网页搜索工具和文献数据库已经足够强大,文献之间的**引用网络(citation graph)**也足够密集。你只要从一篇核心论文出发,顺着引用关系向前、向后追溯,就能拼出一幅相当完整的研究图景。
但现实中,并不是所有问题都这么“规整”。
有些问题的文献非常零散,没有统一的名字;
有些分散在不同学科、不同期刊,研究者彼此甚至互不知情;
还有一些论文在讨论该问题时,夹杂了大量无关内容,导致引用链条里充满“噪音”。
在这些情况下,用传统工具仍然可以找到相关文献,但过程往往异常耗时:
你可能要费力去找一些冷门期刊的文章,
或者反复通读许多“可能相关、但最终无关”的论文,
才能偶然发现一篇真正命中问题核心的研究。
好消息是,一旦你真的找到了那篇关键论文,对专家来说,判断它是否已经解决了问题,通常并不困难。
正是因为文献搜索的结果可以被独立验证,它成为了一个非常适合 AI 介入的应用场景——前提是,使用者本身具备足够的专业能力,能够进行核查。
而当这种工具被规模化使用时,它的优势就更加明显了。此时,我们并不要求 AI 的成功率达到 100%。它只需要做到一件事:
在相同的时间和精力投入下,带来“更多有用结果、更少无用结果”,就已经胜过传统搜索方式。
更重要的是,学习如何正确使用 AI 工具的成本,可以被多次使用摊薄。这使得 AI 在大规模任务中的性价比变得非常诱人。
一个最近发生的真实案例,来自 Erdős Problem 网站(https://www.erdosproblems.com/)。
这个网站收录了 1000 多个由著名数学家 Paul Erdős 提出的问题,其中大约 600 个目前被标注为“未解决(open)”。
需要注意的是,这个“未解决”的标注,很多时候只是基于一次相对粗略的文献搜索。
有些问题其实非常有名、文献浩如烟海;
但也有不少问题相当冷门,相关研究并不显眼。
就在最近几天,网站上的几位贡献者开始系统性地使用 AI 深度研究工具来查找相关文献。AI 给出的结果并不会直接写入网站,而是先由人工审核;只有在确认有价值之后,才会以评论的形式补充进去。
结果非常惊人:
已经有 6 个问题,在 AI 辅助下被确认其实早已解决,于是状态从 “open” 更新为 “solved”:
https://www.erdosproblems.com/339
https://www.erdosproblems.com/1043
https://www.erdosproblems.com/494
https://www.erdosproblems.com/621
https://www.erdosproblems.com/822
https://www.erdosproblems.com/903
此外,还有十多个问题虽然仍然是“未解决”,但 AI 找到了此前被忽略的相关文献,并在人工核查后被补充进了评论区。
并非所有这些贡献都明确标注为“AI 找到的”,但自从这个实验启动以来,这类高质量文献补充的评论数量明显上升,强烈暗示其中相当一部分确实得益于 AI 的辅助。
这种工具化使用 AI 的方式,还有一个潜在但非常重要的优势:
它可能让“负结果”更容易被报告出来。
在传统的人工文献综述中,如果你查遍文献却什么也没找到,这个“什么也没找到”的结果,往往不会被明确写出来。
研究者可能会担心:
“万一我漏看了一篇关键论文,岂不是很尴尬?”
于是,类似“据我们所知,这是该问题的首次进展”这样的表述,虽然偶尔会出现,但系统性的“未发现相关文献”几乎不会被报告。
这会带来两个问题:
一是,不同研究者可能反复、徒劳地去寻找同一批并不存在的文献;
二是,一个问题可能被长期误认为“未解决”,只是因为此前从未有人认真做过全面的文献搜索,而解决方案其实一直躺在文献里。
但当你用 AI 工具,对一大批问题进行系统化的文献回顾时,报告正结果和负结果都会变得更自然。例如:
“在本次工具审查的 36 个问题中,有 24 个(66%)找到了我们此前未掌握的相关文献;而另外 12 个(33%)只返回了已知或不相关的参考资料。”
这样的统计,能更真实地反映某个问题在现有文献中的实际状态。