LLM درجہ بندی · اپ ڈیٹ شدہ 5 اگست، 2026

The Definitive
LLM Leaderboard.

673 زبان کے ماڈلز کا موازنہ 25 بینچ مارکس، ارینا ووٹس، قیمتوں اور رفتار پر — پانچ آزاد لیڈر بورڈز کو ملا کر۔

5 آزاد لیڈر بورڈز سے مرتب:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
llmpodium eval --benchmark suite
$llmpodium compare claude-mythos-preview vs claude-fable-5
EvaluatingRunning SWE-Bench, AIME, GPQA & Arena Elo...
Claude Mythos Preview: Score 97.4 · 80 t/s · Rank #1
Claude Fable 5: Score 93.4 · 71 t/s · 1509 Elo
Podium VerdictClaude Mythos Preview leads overall composite index
$
Tracked AI Labs
OpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaiduOpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaidu
673+
ماڈلز
Flagship curated
25
بینچ مارک
Rigorous evals
44
فراہم کنندگان
Global AI labs
719
ارینا میں ماڈلز
Human battle Elo
01 · Real-Time Rankings

سرکردہ ماڈلز

سب دیکھیں ←

Top 10 Models by Overall Podium Score

سب دیکھیں ←
#ماڈلPodium Scoreارینا Eloکوڈنگرفتارقیمت (آؤٹ پٹ)
01
Claude Mythos Preview
Anthropic · Proprietary
97.4
80.980 t/s$15/M
02
Claude Fable 5
Anthropic · Proprietary
93.4
150984.171 t/s$50/M
03
Kimi K3
Moonshot AI · Open Weights
83.3
148561.537 t/s$15/M
4
Claude Opus 5
Anthropic · Proprietary
81.4
149270.460 t/s$25/M
5
GPT-5.6 Sol
OpenAI · Proprietary
80.8
148364.872 t/s$30/M
6
Qwen3.8 Max
Alibaba · Proprietary
79.8
149650.355 t/s$2/M
7
Claude Opus 4.8
Anthropic · Proprietary
76.0
148458.050 t/s$15/M
8
Claude Opus 4 6 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
9
Claude Opus 4 7 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
10
Claude Opus 5 Max
Anthropic · Unknown
75.0
50 t/s$15/M
02 · Evaluation Domains

کام کے لحاظ سے بہترین

سب دیکھیں ←
03 · Research & Analysis

تازہ ترین مضامین

تمام مضامین

Open LLM Intelligence Platform

Find the perfect model for your workflow.

Compare accuracy, price-per-token, latency, and real-world agent performance across 700+ language models in seconds.

04 · FAQ

اکثر پوچھے گئے سوالات

تمام سوالات
ہر ماڈل کو ایک Podium Score (0–100) ملتا ہے — چار اشاروں کا وزنی امتزاج: 35% انسانی موازنے سے ارینا Elo، 30% بینچ مارک اوسط، 20% Artificial Analysis کا انٹیلیجنس انڈیکس اور 15% LLM Stats اسکور۔ تمام اشاروں کو ایک مشترکہ پیمانے پر معمول کیا جاتا ہے۔
Claude Mythos Preview 97.4 کے ساتھ سر فہرست ہے۔ اس کے بعد Claude Fable 5 (93.4) اور Kimi K3 (83.3)۔ نئے ووٹس اور نتائج آنے پر درجہ بندی ہر ہفتے بدلتی ہے۔
ہم 18 زمروں (کوڈنگ، ریاضی، استدلال، ایجنٹس، علم، ملٹی موڈل، طویل سیاق، رفتار، قدر اور اوپن ویٹس) میں 673 فلیگ شپ ماڈلز منتخب کرتے ہیں، اس کے علاوہ 719 ماڈلز کی مکمل ارینا ٹیبل۔
پانچ عوامی لیڈر بورڈز سے: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase۔ ہر ذریعہ ہر ہفتے ہم آہنگ ہوتا ہے؛ درست فارمولا طریقہ کار کے صفحے پر ہے۔