💻 Coding · llm-stats.com
SWE-Bench Pro
Harder, contamination-resistant successor to SWE-Bench with commercial-repo issues.
20
Modelos probados
Claude Mythos Preview
Modelo destacado
77.8%
Mejor puntuación
Anthropic
Proveedor
| # | Modelo | SWE-Bench Pro |
|---|---|---|
| 1 | Claude Mythos Preview Anthropic | 77.8% |
| 2 | Claude Opus 4.8 Anthropic | 69.2% |
| 3 | Qwen3.8 Max Alibaba | 67.7% |
| 4 | Grok 4.5 xAI | 64.7% |
| 5 | GPT-5.6 Sol OpenAI | 64.6% |
| 6 | Claude Opus 4.7 Anthropic | 64.3% |
| 7 | GPT-5.6 Terra OpenAI | 63.4% |
| 8 | GPT-5.6 Luna OpenAI | 62.7% |
| 9 | GLM-5.2 Z.ai | 62.1% |
| 10 | Qwen3.7 Max Alibaba | 60.6% |
| 11 | GPT-5.5 OpenAI | 58.6% |
| 12 | Kimi K2.6 Moonshot AI | 58.6% |
| 13 | Hunyuan Hy3 Tencent | 57.9% |
| 14 | GPT-5.4 OpenAI | 57.7% |
| 15 | Qwen3.7 Plus Alibaba | 57.6% |
| 16 | Qwen3.6 Plus Alibaba | 56.6% |
| 17 | DeepSeek V4 Pro DeepSeek | 55.4% |
| 18 | Gemini 3.1 Pro Google | 54.2% |
| 19 | DeepSeek V4 Flash DeepSeek | 52.6% |
| 20 | Muse Spark Meta | 52.4% |
Datos agregados de llm-stats.com. Ver Metodología.