
一天审完两万篇,AI抢了审稿人的饭碗?聊聊AAAI-26那场“冒天下之大不韪”的实验
搞学术的朋友应该都深有体会,顶会审稿早就成了整个学术圈的“集体地狱”——投稿量年年暴涨,审稿人卷到飞起,却还是赶不上论文提交的速度;好不容易等来审稿意见,不是空泛到离谱的“创新性不足”,就是审稿人压根没看懂论文的阴间吐槽,甚至还有人情稿、恶意审稿的骚操作,早就把大家折磨得没脾气了。
但就在最近,一篇顶会官方背书的论文直接把学术圈炸翻了:AAAI-26(国际人工智能顶会)搞了一场史上最大规模的AI审稿试点,给主赛道22977篇进入全评审阶段的论文,每一篇都配了官方生成、明确标注的AI评审意见。更离谱的是,最终调研结果显示:在技术准确性、研究建议等核心维度,参会的学者们居然更偏爱AI写的审稿意见,而非人类审稿人。
先给大家报一下这篇论文的“户口本”,避免有人觉得这是哪个小团队的野路子实验。
•论文标题:AI-Assisted Peer Review at Scale: The AAAI-26 AI Review Pilot(大规模AI辅助同行评审:AAAI-26 AI评审试点)
•发表信息:2026年4月15日发布于arXiv预印本平台,对应的AAAI-26审稿流程于2025年8-11月完成,是实打实的落地后复盘研究
•作者团队:堪称AI学术圈的“顶配阵容”,核心作者来自德州大学奥斯汀分校、阿尔伯塔大学、密歇根大学、俄勒冈州立大学等顶尖高校,还有索尼AI、阿尔伯塔机器智能研究院的学者加盟。其中不乏Peter Stone这样的AAAI前主席、机器人领域泰斗级人物,整个项目从设计到落地,全程有AAAI官方的深度参与和背书。
简单说,这不是某个团队随便搞的实验室测试,而是全球顶流AI会议官方发起、全流程合规、覆盖全量投稿的一次“AI审稿转正”实验,含金量直接拉满。
很多人可能会问:学术同行评审搞了几百年,为啥AAAI非要冒天下之大不韪,让AI进场?说白了,不是想搞新花样,是传统审稿模式真的快被卷崩了,这是市场和技术双重驱动下的必然尝试。
顶会投稿的暴涨速度,早就超出了人类审稿的承载极限。就拿AAAI来说,2025年的投稿量大概是15000篇,到了2026年直接飙升到30000多篇,短短一年翻了一倍。
投稿量翻倍,意味着什么?意味着组委会要招更多的审稿人。AAAI-26硬生生招了超过28000名程序委员、高级程序委员和领域主席,规模是2025年的近3倍。但就算这样,还是解决不了核心问题:
•审稿人严重过载,人均要审的论文越来越多,只能草草扫一眼给意见,评审质量直线下滑;
•为了凑够审稿人,只能招越来越多经验不足的年轻学者,审稿水平参差不齐,意见离谱是常事;
•审稿周期被极度压缩,本来要花几个小时精读的论文,现在只能几十分钟看完,根本抓不住核心问题。
而且这不是AAAI一家的毛病,Nature、NeurIPS等顶刊顶会,全在面临同样的投稿暴涨困境,传统的纯人工审稿模式,已经走到了瓶颈期。
其实AI审稿不是什么新鲜事,之前就有很多研究,甚至很多审稿人早就偷偷用LLM写审稿意见了,只是一直没被官方认可。
但之前的AI审稿有个致命问题:直接让通用大模型写评审,写出来的东西要么空泛无物,要么瞎编乱造,甚至连论文的核心内容都没读懂,完全没法用。学界也早就验证了,单靠一句“帮我写个论文审稿意见”的prompt,根本出不来高质量的评审。
而近几年,大模型在数学推理、代码理解、技术文档解析上的能力突飞猛进,同时多阶段agent、工具调用、分层推理这些技术也越来越成熟,大家终于意识到:与其让LLM一步到位写评审,不如给它搭一套完整的“审稿流水线”,让它像人类资深审稿人一样,分步骤、分模块地拆解论文,逐项核查,最终生成靠谱的意见。
AAAI这次的试点,就是把这个思路,第一次落地到了顶会的全量投稿里。
很多人以为,这个系统就是把论文丢给GPT-5,让它随便写个评语。大错特错!这次AAAI用的AI评审系统,完全是一套工业化的“审稿工厂”,从论文预处理到最终评审输出,全流程有严格的流水线设计,每一个环节都有明确的分工,这也是它能吊打通用LLM的核心原因。
整个系统的流程,咱们拆成大白话给大家讲明白:
很多人不知道,AI读学术论文PDF,最大的痛点就是读不懂公式、表格、复杂图表,很容易出现理解偏差。所以这套系统先做了两道预处理:
1. 把论文里的所有图片统一重采样到250DPI,避免因为图片分辨率太高,炸了大模型的上下文窗口;
2. 用专门的学术OCR工具olmOCR,把PDF论文转换成带LaTeX格式的markdown文档,公式、表格、算法全都精准转成了大模型能读懂的格式,从根源上解决了“读不懂”的问题。
这是整个系统的灵魂,团队没有让大模型一次性评审整篇论文,而是把学术评审的核心要求,拆成了5个独立的阶段,每个阶段只聚焦一个评审维度,还配上了对应的工具,让专业的环节干专业的事:
1. 故事阶段:专门核查论文的问题定义准不准、声称的领域缺口存不存在、核心贡献是什么、实验证据能不能支撑核心结论,说白了就是先搞懂这篇论文到底想讲个什么故事,逻辑通不通;
2. 呈现阶段:聚焦论文的清晰度、结构、可读性、叙事逻辑,查的是写作和排版的问题,比如章节安排合不合理、表述清不清晰、有没有低级的笔误;
3. 评估阶段:死磕论文的实验部分,基线选的合不合理、数据集规不规范、指标用的对不对、统计证据充不充分、实验能不能复现,这个阶段还给大模型配了代码解释器,能直接跑代码验证实验结果;
4. 正确性阶段:专门核查论文的硬核技术部分,公式推导对不对、证明严不严谨、算法逻辑有没有bug、图表数据对不对得上,同样配了代码解释器,能直接验证数学和算法的正确性;
5. 重要性阶段:聚焦论文的创新性和领域定位,通过网页搜索工具,查顶会顶刊已发表的相关工作,判断论文的 novelty 够不够、有没有漏掉关键的相关工作对比,而且严格要求只认已发表的同行评审成果,不认预印本,避免瞎对比。
每个阶段的结果,都会完整传递给下一个阶段,确保整个评审过程不会遗漏关键信息,也不会出现前后矛盾的问题。
光写完初稿还不够,团队给系统加了两道关键的质检环节,解决大模型最让人头疼的幻觉问题:
1. 自我批判环节:让大模型拿着初稿评审,回头对照原文逐行检查,挑出自己写的内容里没有证据支撑的 claims、事实错误、引用问题,然后针对性修改,生成最终的评审意见;
2. AI+人工双重质检:先让另一个独立的大模型,对所有生成的评审做质检,排查有没有泄露作者匿名信息、不当言论、偏见、结构缺失等问题;再由人工对所有被标记有风险的评审做二次核查,确保不会出现离谱的错误。
这套系统,在24小时之内,就完成了22977篇论文的全流程评审,单篇论文的成本不到1美元。就算是3万篇全量投稿,总成本也不到3万美元,连AAAI会议预算的零头都不到,性价比直接吊打纯人工审稿。
整个研究最核心的干货,都藏在这几个keypoint里,每一个都足以颠覆大家对AI审稿的认知:
这不是实验室里的模拟测试,也不是小范围的辅助工具,而是全球顶会首次在正式审稿流程中,给每一篇进入全评审阶段的论文,都配上了官方生成的AI评审。而且全程合规透明:AI评审会明确标注身份,在双盲评审中,作者和审稿人都知道这是AI写的;AI评审只给意见,不打分数、不做录用推荐,也没有替换任何一个人类审稿人,只是作为补充信息,给作者、审稿人、领域主席做参考,完全没有越界。
这是整个研究最炸裂的结果。团队回收了5834份来自作者、审稿人、高级程序委员、领域主席的有效调研问卷,对比了大家对AI评审和人类评审的评价,结果直接惊掉了所有人的下巴:在9个核心评审维度里,AI评审在6个维度上的评分,显著高于人类评审。其中领先幅度最大的,是「准确识别技术错误」,其次是「提出了之前没考虑到的问题」「改进论文呈现的有效建议」「改进研究设计的有效建议」「评审的全面性」「准确传达论文的意义和影响」。更有意思的是,作者对AI评审的偏爱,比审稿人、领域主席们强烈得多——毕竟谁不想要具体、可落地的修改意见,而不是一句空泛的“创新性不足,建议拒稿”呢?
为了验证这套系统的硬实力,团队还专门做了一个叫SPECS的审稿基准测试,专门评估AI系统在故事、呈现、评估、正确性、重要性这五大维度上,识别论文科学错误的能力。测试结果显示,这套多阶段的AI评审系统,相比“直接让通用LLM写评审”的基线方案,整体错误识别率提升了20.95%,在每一个维度上都有统计意义上的显著提升。而且每个阶段都精准命中了对应的目标问题,比如正确性阶段最擅长抓公式算法的错误,评估阶段最会找实验设计的漏洞,分工明确,效果拉满。
很多人看到这里会问:AI这么厉害,以后人类审稿人是不是要失业了?完全不用担心,因为这套系统的优点和缺点,都极端鲜明,甚至缺点直接命中了学术评审的核心。它的优点有多突出,缺点就有多致命:
✅ 核心优点:客观公正,没有人情世故,不会恶意审稿,也不会给大牛放水;技术细节抓得极准,人类很容易漏掉的公式、代码、实验细节错误,它都能精准找到;评审意见可操作性极强,不会给空泛的批评;一致性强,不会出现不同审稿人水平天差地别的情况。
❌ 致命缺点:大局观稀碎,对论文的创新性、科学意义、领域长期贡献的判断能力拉胯,这也是被吐槽最多的点;爱抠鸡毛蒜皮的小事,过度放大次要问题;写的内容过于冗长,看得人脑壳疼;偶尔会读错复杂公式和表格,出现事实性错误。
整个研究最核心的结论,从来都不是“AI打败了人类”,而是“AI和人类是互补的”。调研数据显示,近一半的审稿人认为,AI找到了人类很难发现的技术问题;同时也有近一半的审稿人表示,AI漏掉了人类一眼就能抓住的核心问题。只有13.8%的审稿人说,AI评审改变了他们对论文的评价,绝大多数人,都是把AI评审当成了技术核查的补充工具,最终的学术判断,还是由人类自己做。
说白了,AI能干的,是那些重复、繁琐、需要极致细心的“技术质检员”的活;而人类要干的,是判断一个研究有没有价值、有没有创新性、能不能推动领域发展的“学术守门人”的活,两者根本不是替代关系。
这篇论文一出来,整个学术圈直接分成了三大阵营,吵得不可开交,每一方的观点都有极强的道理,咱们挨个给大家捋清楚:
支持的一方,大多是被审稿折磨疯了的一线科研人员,他们的核心观点很明确:
•终于不用再干脏活累活了!查公式、查代码、查基线、查格式,这些耗时耗力又没什么技术含量的活,AI全干了,人类审稿人终于能把精力放在最核心的创新性和科学价值判断上,效率直接拉满;
•解决了审稿公平性的千古难题!顶会审稿一直被吐槽“看人脉、看运气、看审稿人心情”,AI没有偏见,一视同仁,不会因为作者是大佬就放水,也不会因为是新人就恶意拒稿,能极大减少人情稿、关系稿;
•给了普通作者更公平的机会!以前投稿被拒,连个具体的修改理由都拿不到,现在AI给的意见全是具体、可落地的,哪怕被拒了,也知道怎么改,而不是摸黑瞎撞;
•彻底解决了投稿量暴涨的行业痛点,以后哪怕投稿量再翻一倍,也不用愁找不到足够的审稿人,更不用逼着学者们无休无止地审稿了。
反对的一方,大多是领域内的资深学者、期刊会议的组织者,他们的担忧,也直击要害:
•学术的核心,永远是“人的判断”!顶会审稿的本质,从来不是查公式有没有错,而是判断一个工作有没有给领域带来真正的创新,有没有长远的科学价值,这些东西,AI根本学不会。现在让AI进场,完全是本末倒置;
•会把学术圈彻底带歪!以后作者写论文,不是想着怎么做好科研,而是想着怎么迎合AI的喜好,怎么让AI挑不出错,最后写出来的全是“AI友好型”的八股文,真正有颠覆性、有风险的创新,反而会被AI挑一堆毛病,直接扼杀在摇篮里;
•断了年轻学者的成长之路!读博、做科研,审稿是核心的学术训练,只有通过审稿,你才能知道领域里的好工作是什么标准,才能学会怎么评判一个研究。现在都让AI干了,年轻学者连审稿的机会都没有,以后学术传承都要断档了;
•幻觉问题是定时炸弹!哪怕AI的错误率只有1%,放到2万多篇论文里,就是几百篇论文被错误评价误导,万一领域主席信了AI的话,把好论文拒了,把烂论文放了,这个责任谁来担?
还有大量的学者保持了中立,他们的观点也最理性:
•别把AI审稿神化,它现在的能力,最多当个“学术质检员”,帮你补上技术上的漏洞,绝对当不了“学术守门人”,最终的判断,必须由人来做;
•也别把它妖魔化,它跟你用Word写论文、用LaTeX排公式、用文献管理软件整理参考文献没区别,就是一个提升效率的工具,用不用、怎么用,决定权永远在人手里;
•未来的正确方向,是人机协同,而不是非此即彼。AI干它擅长的事,人类干自己擅长的事,两者结合,才能既提升审稿效率,又保住学术评审的核心价值;
•现在还只是试点,还有很多问题要解决,比如怎么控制幻觉、怎么避免作者迎合AI、怎么平衡AI和人类评审的权重,这些都需要慢慢摸索,没必要一上来就全盘肯定或者全盘否定。
这篇论文的意义,从来不是证明“AI能替代人类审稿人”,而是给已经陷入瓶颈的学术同行评审体系,提供了一个全新的可能性。
几百年来,学术圈的同行评审模式,几乎没有发生过本质的变化。而AI的出现,不是要推翻这个体系,而是给它打了一剂补丁,让它能适配这个投稿量暴涨、信息爆炸的时代。
未来的学术评审,大概率不会是纯AI的天下,也不会再回到纯人工的模式,而是人机协同的新范式:AI做技术兜底,把好论文的技术关;人类做价值判断,守住学术创新的核心。
至于这条路最终能走多远,AI到底能不能给学术圈带来更公平、更高效的评审环境,就留给时间来验证了。
原文链接:https://arxiv.org/pdf/2604.13940