LLM Leaderboard

The Definitive
LLM Ranking

Compare 25+ language models across 10 benchmarks. Rankings, pricing, speed, and reasoning — all in one place.

GPT-4oGPT-4o Minio3o4-miniClaude 3.5 SonnetClaude 3.5 HaikuClaude Opus 4Claude Sonnet 4Gemini 2.5 ProGemini 2.5 FlashGemini 2.0 FlashLlama 3.1 405BLlama 3.1 70BLlama 3.3 70BLlama 4 MaverickMistral LargeMixtral 8x22BDeepSeek V3DeepSeek R1Qwen 2.5 72BQwen 3 235BCommand R+Grok 2Grok 3Phi-4GPT-4oGPT-4o Minio3o4-miniClaude 3.5 SonnetClaude 3.5 HaikuClaude Opus 4Claude Sonnet 4Gemini 2.5 ProGemini 2.5 FlashGemini 2.0 FlashLlama 3.1 405BLlama 3.1 70BLlama 3.3 70BLlama 4 MaverickMistral LargeMixtral 8x22BDeepSeek V3DeepSeek R1Qwen 2.5 72BQwen 3 235BCommand R+Grok 2Grok 3Phi-4
25+
Models Tracked
10
Benchmarks
25+
Providers
Weekly
Data Updates

Top Models

View All →
#ModelCompositeELOMMLUSWE-BenchSpeed
1
Claude Opus 4
Anthropic
97.8138592.1%72.5%45 t/s
297.5139892%63.8%85 t/s
3
o3
OpenAI
97.1138091.2%71.7%58 t/s
4
DeepSeek R1
DeepSeek
92.3135890.8%49.2%32 t/s
5
o4-mini
OpenAI
91.5134588.3%68.1%145 t/s
690.3134090.4%62.3%79 t/s
7
GPT-4o
OpenAI
89.2128788.7%38.4%110 t/s
888.8133089.2%55.2%55 t/s
988.4127288.7%49%82 t/s
1087.5132589.5%47.5%120 t/s
Categories

Browse by Task

Blog

Latest Insights

All Articles
FAQ

Common Questions

All FAQ
We compute a composite score from multiple benchmark results including MMLU, GPQA, SWE-Bench, HumanEval, AIME, and Arena ELO. The composite is a weighted average emphasizing real-world task performance.
We update benchmark scores and pricing data on a weekly basis. Major model releases trigger an immediate update cycle.
Yes! Visit our Compare page to select up to 4 models and see a side-by-side breakdown of all metrics.