
SWE-Bench Pro 在 SWE-Bench Verified 等现有基准的基础上,解决了AI评估中的关键挑战:
• 杜绝数据污染: 我们采用模型未曾训练过的代码,这些代码来源于受强Copyleft许可(如GPL)约束的公共代码库和Scale内部的私有商业代码库,确保智能体是真正解决问题,而非回忆记忆中的解决方案。
• 任务多样且复杂: SWE-Bench Pro 包含来自41个代码库(包括面向消费者的应用、B2B服务和开发者工具)的1,865个任务实例,全面覆盖了真实世界的软件工程挑战。
• 真实世界难题: 我们保留了模糊或未充分说明的问题,并辅以人工增强的问题描述,这些任务平均需要修改107.4行代码,涉及4.1个文件,充分反映了真实开发者的工作流程。
• 可靠且可复现的测试: 每个任务都在一致的容器化环境中进行评估,自动验证智能体的补丁是否修复了预期问题(“fail-to-pass”)且未引入新的缺陷(“pass-to-pass”)。
初步评估揭示了性能的显著变化:
• 性能显著下降: OpenAI GPT-5 和 Claude Opus 4.1 等前沿模型在 SWE-Bench Verified 上得分超过70%,但在 SWE-Bench Pro 的公共数据集上,其得分大幅下降至约 23%。

• 商业代码集难度更高: 在私有商业代码子集上,模型性能进一步下降,凸显了在未见过的专有代码上实现真正泛化的挑战。

• 前沿模型表现突出: 尽管整体性能下降,但顶级模型仍显著优于旧模型,展现了其先进能力,但整体仍有巨大提升空间。
• 性能因语言和代码库而异: 模型的成功率因编程语言(Go和Python通常更高)和代码库复杂性而异,这指明了具体的改进方向。


原文: https://scale.com/blog/swe-bench-pro
swebench 排名: https://www.swebench.com/
OpenAI 官方关于 swebench 介绍: https://openai.com/index/introducing-swe-bench-verified/