Benchmark
SWE-Bench
Software Engineering Benchmark
Real-world GitHub issue resolution across popular open-source repositories.
25
Models Tested
Claude Opus 4
Top Model
72.5%
Top Score
100 %
Max Possible
| # | Model | SWE-Bench Score |
|---|---|---|
| 1 | Claude Opus 4 Anthropic | 72.5% |
| 2 | o3 OpenAI | 71.7% |
| 3 | o4-mini OpenAI | 68.1% |
| 4 | Gemini 2.5 Pro Google | 63.8% |
| 5 | Claude Sonnet 4 Anthropic | 62.3% |
| 6 | Grok 3 xAI | 55.2% |
| 7 | DeepSeek R1 DeepSeek | 49.2% |
| 8 | Claude 3.5 Sonnet Anthropic | 49% |
| 9 | Gemini 2.5 Flash Google | 48.2% |
| 10 | Llama 4 Maverick Meta | 47.5% |
| 11 | DeepSeek V3 DeepSeek | 42% |
| 12 | Qwen 3 235B Alibaba | 41.3% |
| 13 | Claude 3.5 Haiku Anthropic | 40.6% |
| 14 | GPT-4o OpenAI | 38.4% |
| 15 | Gemini 2.0 Flash Google | 36.8% |
| 16 | Llama 3.1 405B Meta | 35.2% |
| 17 | Llama 3.3 70B Meta | 32.8% |
| 18 | Mistral Large Mistral AI | 30.1% |
| 19 | Grok 2 xAI | 28.3% |
| 20 | Llama 3.1 70B Meta | 27.3% |
| 21 | Qwen 2.5 72B Alibaba | 26.5% |
| 22 | GPT-4o Mini OpenAI | 23.4% |
| 23 | Mixtral 8x22B Mistral AI | 18.2% |
| 24 | Command R+ Cohere | 15.8% |
| 25 | Phi-4 Microsoft | 12.5% |
Source: Jimenez et al., 2024