💻 Coding · llm-stats.com

SWE-Bench Pro

Harder, contamination-resistant successor to SWE-Bench with commercial-repo issues.

20
Modelos testados
Claude Mythos Preview
Modelo principal
77.8%
Melhor pontuação
Anthropic
Provedor
#ModeloSWE-Bench ProProvedorPodium Score
1
77.8%
Anthropic97.4
2
69.2%
Anthropic76.0
3
67.7%
Alibaba79.8
4
64.7%
xAI61.3
5
64.6%
OpenAI80.8
6
64.3%
Anthropic52.0
7
63.4%
OpenAI66.4
8
62.7%
OpenAI49.1
9
62.1%
Z.ai59.1
10
60.6%
Alibaba51.0
11
GPT-5.5
OpenAI
58.6%
OpenAI54.0
12
Kimi K2.6
Moonshot AI
58.6%
Moonshot AI49.0
13
57.9%
Tencent38.9
14
GPT-5.4
OpenAI
57.7%
OpenAI51.0
15
57.6%
Alibaba42.2
16
56.6%
Alibaba32.4
17
55.4%
DeepSeek46.0
18
54.2%
Google60.6
19
52.6%
DeepSeek42.0
20
52.4%
Meta47.0
Dados de benchmark agregados de llm-stats.com. Saiba mais na metodologia.