💻 Coding · llm-stats.com

SWE-Bench Verified

Real GitHub issues resolved end-to-end; the industry standard for agentic coding.

28
Model diuji
Claude Fable 5
Model teratas
95%
Skor terbaik
Anthropic
Penyedia
#ModelSWE-Bench VerifiedPenyediaPodium Score
1
95%
Anthropic93.4
2
93.9%
Anthropic97.4
3
88.6%
Anthropic76.0
4
87.6%
Anthropic52.0
5
85.2%
Anthropic45.4
6
80.9%
Anthropic52.1
7
80.8%
Anthropic61.2
8
80.6%
Google60.6
9
80.6%
DeepSeek46.0
10
MiniMax M3
MiniMax
80.5%
MiniMax39.6
11
80.4%
Alibaba51.0
12
Kimi K2.6
Moonshot AI
80.2%
Moonshot AI49.0
13
GPT-5.2
OpenAI
80%
OpenAI49.2
14
79.6%
Anthropic38.1
15
79%
DeepSeek42.0
16
78.9%
Xiaomi48.0
17
78.8%
Alibaba32.4
18
78%
Google42.4
19
78%
Tencent38.9
20
77.7%
Alibaba42.2
21
77.4%
Meta47.0
22
Seed 2.0 Pro
ByteDance
76.5%
ByteDance40.0
23
76.4%
Alibaba23.9
24
GPT-5.1
OpenAI
76.3%
OpenAI42.3
25
76.2%
Google51.9
26
GPT-5
OpenAI
74.9%
OpenAI23.0
27
74.5%
Anthropic21.7
28
73.1%
DeepSeek12.9
Data benchmark digabungkan dari llm-stats.com. Selengkapnya di metodologi.