💻 Coding · llmbase.ai
SciCode
Scientific coding problems requiring domain knowledge and multi-function solutions.
31
Modelos testados
Claude Fable 5
Modelo principal
60.2%
Melhor pontuação
Anthropic
Provedor
| # | Modelo | SciCode |
|---|---|---|
| 1 | Claude Fable 5 Anthropic | 60.2% |
| 2 | Gemini 3.1 Pro Google | 59% |
| 3 | Kimi K3 Moonshot AI | 58.7% |
| 4 | Muse Spark 1.1 Meta | 58.2% |
| 5 | GPT-5.6 Sol OpenAI | 56.1% |
| 6 | GPT-5.5 OpenAI | 56.1% |
| 7 | Gemini 3 Pro Google | 56.1% |
| 8 | Claude Opus 5 Anthropic | 55.7% |
| 9 | Grok 4.5 xAI | 54.1% |
| 10 | GPT-5.6 Terra OpenAI | 53.9% |
| 11 | Claude Opus 4.8 Anthropic | 53.5% |
| 12 | Qwen3.7 Max Alibaba | 53.5% |
| 13 | GPT-5.3 Codex OpenAI | 53.2% |
| 14 | Gemini 3.5 Flash Google | 53.1% |
| 15 | Gemini 3.6 Flash Google | 52.7% |
| 16 | GPT-5.6 Luna OpenAI | 52.5% |
| 17 | Kimi K2.6 Moonshot AI | 52.2% |
| 18 | Muse Spark Meta | 51.5% |
| 19 | Qwen3.7 Plus Alibaba | 51.3% |
| 20 | GLM-5.2 Z.ai | 50.5% |
| 21 | MiMo V2.5 Pro Xiaomi | 50.2% |
| 22 | DeepSeek V4 Flash DeepSeek | 49.9% |
| 23 | Claude Sonnet 5 Anthropic | 48.6% |
| 24 | Hunyuan Hy3 Tencent | 47.6% |
| 25 | Kimi K2.7 Code Moonshot AI | 47.5% |
| 26 | Inkling Thinking Machines | 46.1% |
| 27 | Claude Opus 4.6 Anthropic | 45.7% |
| 28 | MiniMax M3 MiniMax | 45.4% |
| 29 | DeepSeek V4 Pro DeepSeek | 42.4% |
| 30 | Qwen3.6 Plus Alibaba | 40.7% |
| 31 | Nemotron 3 Ultra 550B NVIDIA | 39.9% |
Dados de benchmark agregados de llmbase.ai. Saiba mais na metodologia.