LLM रैंकिंग · अपडेट किया गया 5 अग॰ 2026
The Definitive
LLM Leaderboard.
673 भाषा मॉडलों की तुलना 25 बेंचमार्क, एरीना वोट, कीमत और गति पर — पाँच स्वतंत्र लीडरबोर्ड को मिलाकर।
5 स्वतंत्र लीडरबोर्ड से संकलित:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
673+
मॉडल
Flagship curated
25
बेंचमार्क
Rigorous evals
44
प्रदाता
Global AI labs
719
एरीना में मॉडल
Human battle Elo
01 · Real-Time Rankings
शीर्ष मॉडल
Top 10 Models by Overall Podium Score
सभी देखें →| # | मॉडल | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 4 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 5 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 6 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 7 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 8 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
| 9 | Claude Opus 4 7 Thinking Anthropic · Unknown | 75.0 |
| 10 | Claude Opus 5 Max Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
कार्य के अनुसार सर्वश्रेष्ठ
कोडिंग
कोड इंजीनियरिंग: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench और HumanEval।
नेता: Claude Fable 5
गणित
ओलंपियाड गणित से फ्रंटियर समस्याओं तक: AIME, MATH और FrontierMath।
नेता: Claude Mythos Preview
तर्क
गहन तर्क और विज्ञान: GPQA Diamond, HLE और ARC-AGI-2।
नेता: Claude Mythos Preview
एजेंटिक
स्वायत्त उपकरण और कंप्यूटर संचालन: OSWorld, Toolathlon, MCP Atlas, τ²-Bench।
नेता: Kimi K3
ज्ञान
तथ्य और भ्रम-प्रतिरोध: SimpleQA, MMLU-Pro और MMMLU।
नेता: Claude Mythos Preview
मल्टीमोडल
छवि और दस्तावेज़ समझ: MMMU, CharXiv और ScreenSpot-Pro।
नेता: Claude Mythos Preview
03 · Research & Analysis
नवीनतम लेख
04 · FAQ
अक्सर पूछे जाने वाले प्रश्न
हर मॉडल को एक Podium Score (0–100) मिलता है — चार संकेतों का भारित मिश्रण: 35% मानव तुलना से एरीना Elo, 30% बेंचमार्क औसत, 20% Artificial Analysis का Intelligence Index और 15% LLM Stats स्कोर। सभी संकेतों को एक समान पैमाने पर सामान्य किया जाता है।
Claude Mythos Preview 97.4 के साथ शीर्ष पर है। इसके बाद Claude Fable 5 (93.4) और Kimi K3 (83.3)। नए वोट और परिणाम आने पर रैंकिंग हर हफ्ते बदलती है।
हम 18 श्रेणियों (कोडिंग, गणित, तर्क, एजेंट, ज्ञान, मल्टीमोडल, लॉन्ग कॉन्टेक्स्ट, गति, मूल्य और ओपन वेट) में 673 फ्लैगशिप मॉडल क्यूरेट करते हैं, साथ ही 719 मॉडलों की पूरी एरीना तालिका।
पाँच सार्वजनिक लीडरबोर्ड से: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase। प्रत्येक स्रोत हर हफ्ते सिंक होता है; सटीक सूत्र कार्यप्रणाली पृष्ठ पर है।