Claude 3.5 Sonnet 更新后在编程领域是目前世界上最好的模型!
在SWE-bench验证测试中的表现从33.4%提高到了49%(SWE-bench 一个专门用于测试大模型解决实际GitHub问题能力的数据集),超过了所有公开模型,包括OpenAI的O1 Preview,并在编程能力创下新纪录,提高到了93.7%,超过了GPT-4o

上面的基准测试不包含 OpenAI的O1 Preview。
Claude Sonnet 3.5 对比 OpenAI的 O1 Preview 在某些基准测试中O1 Preview会优于Sonnet 3.5,但在编码相关的基准测试Claude Sonnet 3.5超越了O1 Preview,而且 O1 Preview有30条消息限制和更高的定价,编程上 claude 3.5 sonnet是目前的最佳选择。

SWE-bench验证编码基准测试,用于测试大模型解决真实GitHub问题方面的表现,从12个流行的Python代码库中收集了2294 issue,大模型解决 issue 后提交 PR。通过单元测试验证 PR 的准确率。这个基准测试能够反映模型在编码上的 主动性和决策能力。 Claude 3.5 Sonnet在这个基准测试中取得了49%的成绩,遥遥领先。 其他模型的分数:

Claude 3.5 Sonnet 排名第一
