Anthropic 用 BioMysteryBench 评估 Claude 在生物信息学研究中的能力
砚青节点
2026年05月02日 08:01

新闻发布日期:2026年4月29日

中文标题:Anthropic 用 BioMysteryBench 评估 Claude 在生物信息学研究中的能力

英文标题:Evaluating Claude’s bioinformatics research capabilities with BioMysteryBench

内容: Anthropic 在这篇文章中发布了一个新的生物信息学评测集 BioMysteryBench,目的是评估 Claude 这类模型在真实科研工作流中的表现,而不是只看它能否回答考试式题目。文章指出,过去常见的科学评测如 MMLU-Pro、GPQA、LAB-Bench 等,主要考察知识和推理能力;而真实生物学研究往往还需要读文献、查数据库、写代码、运行分析流程,并在嘈杂且不完美的数据中做判断,因此传统 benchmark 难以准确衡量模型在科研中的真实能力。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

Anthropic 认为,科学任务之所以难评估,主要有三层原因。第一,生物学研究往往不存在唯一正确的方法,不同研究者可能基于自身专长、可用资源和研究偏好走完全不同的路线,但都能合理地解决问题。第二,生物数据通常噪声很大,研究过程中的很多选择都带有主观性,微小的方法差异就可能导向完全不同的结论。第三,许多最重要的科学问题本身仍是人类没有解决的,因此如果评测只包含“人类已经会做”的题目,就无法衡量模型是否具备超出人类当前能力边界的潜力。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

为解决这些问题,Anthropic 设计了 BioMysteryBench。这个 benchmark 包含 99 道来自不同生物信息学领域的问题,由领域专家编写,并基于真实世界数据集构建。出题方式不是让专家根据主观科学结论来命题,而是围绕数据中可验证、可控、具有客观标准答案的属性来设计问题,例如样本属于什么物种、感染的是哪种病毒、结构数据对应哪个生物体,或者某组实验样本敲除了哪一个基因。这样既能保持任务贴近真实研究,又能避免评测结果被研究者主观判断严重污染。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

文章强调,BioMysteryBench 有几项关键设计。其一,它是“方法无关”的:模型被放进一个容器环境中,拥有一套基础的标准生信工具,可以通过 pip 和 conda 安装额外软件,并能访问 NCBI、Ensembl 等规范数据库下载参考基因组等资源;评分看的是最终答案是否正确,而不是是否走了和人类一样的分析路径。其二,题目具有客观 ground truth,答案来自数据本身可控属性或由正交验证元数据支持,而非研究者的解释性结论。其三,它允许“超人类题目生成”,也就是题目不要求必须被人类专家独立解出,只要能确认数据中确实存在可导出的正确信号即可。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

在题目来源上,BioMysteryBench 主要使用原始或轻度预处理的 DNA 和 RNA 测序数据,因为这类数据是许多生物学分析流程的起点,同时也纳入了部分蛋白质组学和代谢组学任务。文章给出的例子包括:判断单细胞 RNA-seq 数据集来自哪种人体器官、根据 RNA-seq 数据识别实验组敲除了哪个基因、根据全基因组测序判断样本的父母关系、区分 bigWig 文件哪些来自 ChIP 样本哪些来自 input control,以及根据 H3K27ac ChIP-seq peaks 识别未知细胞类型。为了尽量避免“本身无解”的坏题目,每个出题人还必须提交一个 validation notebook,证明正确答案所依赖的信号确实存在于数据中。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

在人类基线部分,Anthropic 让每道题最多由 5 位领域专家从头作答。只要至少有 1 位专家答对,这道题就被归为“人类可解”。最终 99 道题中有 76 道属于人类可解任务。剩余题目经过质检后,去掉了 4 道有问题或损坏的题,保留下 23 道“人类困难”任务,也就是专家小组未能解出的题。这些题并不一定意味着模型真的完成了“科学发现”,但至少表明 benchmark 中包含一类人类专家群体也难以稳定攻克的问题。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

Anthropic 的核心结论是:Claude 在生物信息学上的能力正随代际快速提升,而且最新模型在人类可解任务上已达到与人类专家相当的水平,并在一部分人类困难任务上超过了由 5 名专家组成的评审小组。文章特别提到,Claude Sonnet 4.6 及更强模型能够稳定解决大多数人类可解问题,而 Claude Mythos Preview 在人类困难题上达到 30% 的解题率。这意味着前沿模型不仅能处理标准型科研分析任务,还开始在部分高难问题上展现出超出专家组的表现。

文章进一步分析了 Claude 与人类专家在解题策略上的差异。第一类优势是典型的 AI 优势:模型拥有庞大的预训练知识储备,能够综合结构生物学、分子特征和海量论文中的知识,在某些任务里直接把跨文献、跨数据库的知识整合进分析过程,完成原本需要人类做大量文献综述或元分析的工作。第二类策略则更像一种值得人类科学家借鉴的研究习惯:当模型不确定时,它常常不会只押注单一路径,而会尝试多种方法,从不同证据链中寻找收敛答案,再据此做出判断。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

Anthropic 还特别指出,准确率并不足以完整描述模型能力,可靠性 同样重要。因为每个问题都会尝试 5 次,所以研究人员可以观察模型是“稳定会做”还是“偶然做对”。在“人类可解”题目上,模型表现出明显的双峰特征:要么在 5 次里大多都能答对,要么几乎完全不会,说明此时模型更像是在稳定调用已掌握的方法或知识。相反,在“人类困难”题目上,很多正确答案只出现在 5 次中的 1 次或 2 次,显示出较强的脆弱性,也就是说模型可能是偶然找到了一条有效推理路径,而不是已经掌握了可复现的方法。这说明高难科研任务上,模型虽然已显示潜力,但距离稳定可靠的研究能力仍有差距。

文章还提到,Anthropic 让 Claude Mythos Preview 对 benchmark 结果做了一段“自我分析”。模型认为,相比表面的 headline accuracy,真正更能反映能力边界的是 solve count 的分布:在人类可解集上,正确解答多为高重复性的稳定成功;在人类困难集上,则有大量仅 1/5 或 2/5 成功的脆弱胜利。Anthropic 认可这类分析有一定价值,但也坦言它还比较“保守”,更多是在细化已有结果,而不是提出全新的科学问题,这表明模型可能开始显现出一点“研究品味”的雏形,但离真正深刻的科学洞察还有距离。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

在文章结尾,Anthropic 将 BioMysteryBench 视为一个令人鼓舞的科学能力信号:前沿 Claude 模型在多数人类可解生信任务上已具备可靠表现,在部分人类困难任务上领先于专家组,说明模型不再只是“跟上”训练有素的科学家,而是在某些任务上开始超过他们。与此同时,Anthropic 也承认 benchmark 仍有局限,例如对于人类和模型都没解出的题目,无法完全判定它们究竟是不可能、题目有问题,还是仅仅极其困难。Anthropic 表示,接下来希望继续构建时间跨度更长、更加贴近真实科研流程的任务,以进一步测试模型的研究能力边界。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

关键点:

  • 这篇文章发表于 2026 年 4 月 29 日,属于 Anthropic Science 栏目的一部分,定位不是单纯产品宣传,而是一次关于“如何评估 AI 科学研究能力”的方法论展示。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

  • BioMysteryBench 共包含 99 道题,其中 76 道被定义为人类可解,23 道为经质检后保留的人类困难题;这个划分方式本身就体现了 Anthropic 想把“人类尚未稳定掌握的问题”纳入评测框架。https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench

  • Claude Mythos Preview 在人类困难题上的最高解题率为 30%,这是该文最突出的性能信号之一,也被多家外部报道复述为文章 headline 级结论。

  • BioMysteryBench 的一个重要创新是只按最终答案评分,而不要求模型复现人类研究路径;这使它比一些强调过程对齐的 benchmark 更适合评估开放式科研搜索与创造性解题能力。

  • 文章特别强调“可靠性差距”比“准确率差距”更值得关注:在困难题上,模型正确答案的可复现性明显下降,说明当前前沿模型在高难科学任务上仍存在较大不稳定性。

  • Anthropic 在文中提到,Genentech 和 Roche 同期发布了类似的 CompBioBench,包含 100 个计算生物学任务;Anthropic 引述其结果称,Claude Opus 4.6 在该 benchmark 上总体达到 81%,在最难问题上达到 69%,这为“前沿模型已对生物信息学研究具有实际协作价值”的判断提供了外部呼应。

  • 外部报道还补充指出,BioMysteryBench 已被 Anthropic 公开发布,说明它不仅是内部测试,也意在推动更广泛的科学 AI 评测生态建设。https://pulse2.com/anthropic-releases-biomysterybench-to-evaluate-ai-capabilities-in-bioinformatics-research/amp/

网页链接:Anthropic 原文https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench