ترتيب LLM · آخر تحديث 5 أغسطس 2026

The Definitive
LLM Leaderboard.

مقارنة 673 نموذجاً لغوياً عبر 25 اختباراً وأصوات الأرينا والأسعار والسرعة — بجمع خمس لوحات صدارة مستقلة.

مجمّعة من 5 لوحات صدارة مستقلة:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
llmpodium eval --benchmark suite
$llmpodium compare claude-mythos-preview vs claude-fable-5
EvaluatingRunning SWE-Bench, AIME, GPQA & Arena Elo...
Claude Mythos Preview: Score 97.4 · 80 t/s · Rank #1
Claude Fable 5: Score 93.4 · 71 t/s · 1509 Elo
Podium VerdictClaude Mythos Preview leads overall composite index
$
Tracked AI Labs
OpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaiduOpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaidu
673+
نموذج
Flagship curated
25
اختبار
Rigorous evals
44
مزوّد
Global AI labs
719
نموذج في الأرينا
Human battle Elo
01 · Real-Time Rankings

أفضل النماذج

عرض الكل ←

Top 10 Models by Overall Podium Score

عرض الكل ←
#النموذجPodium ScoreElo الأريناالبرمجةالسرعةالسعر (إخراج)
01
Claude Mythos Preview
Anthropic · Proprietary
97.4
80.980 t/s$15/M
02
Claude Fable 5
Anthropic · Proprietary
93.4
150984.171 t/s$50/M
03
Kimi K3
Moonshot AI · Open Weights
83.3
148561.537 t/s$15/M
4
Claude Opus 5
Anthropic · Proprietary
81.4
149270.460 t/s$25/M
5
GPT-5.6 Sol
OpenAI · Proprietary
80.8
148364.872 t/s$30/M
6
Qwen3.8 Max
Alibaba · Proprietary
79.8
149650.355 t/s$2/M
7
Claude Opus 4.8
Anthropic · Proprietary
76.0
148458.050 t/s$15/M
8
Claude Opus 4 6 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
9
Claude Opus 4 7 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
10
Claude Opus 5 Max
Anthropic · Unknown
75.0
50 t/s$15/M
02 · Evaluation Domains

الأفضل لكل مهمة

عرض الكل ←
03 · Research & Analysis

أحدث المقالات

كل المقالات

Open LLM Intelligence Platform

Find the perfect model for your workflow.

Compare accuracy, price-per-token, latency, and real-world agent performance across 700+ language models in seconds.

04 · FAQ

أسئلة متكررة

كل الأسئلة
يحصل كل نموذج على Podium Score (0–100) — مزيج مرجّح من أربع إشارات: 35% Elo الأرينا من مقارنات بشرية، 30% متوسط الاختبارات، 20% مؤشر الذكاء من Artificial Analysis و15% درجة LLM Stats. تُسوَّى كل الإشارات على مقياس موحد.
Claude Mythos Preview في الصدارة بدرجة 97.4. يليه Claude Fable 5 (93.4) وKimi K3 (83.3). تتغير الترتيبات أسبوعياً مع وصول أصوات ونتائج جديدة.
ننتقي 673 نموذجاً رائداً في 18 فئة (البرمجة، الرياضيات، الاستدلال، الوكلاء، المعرفة، متعدد الوسائط، السياق الطويل، السرعة، القيمة، والأوزان المفتوحة)، إضافة إلى جدول الأرينا الكامل بواقع 719 نموذجاً.
من خمس لوحات صدارة عامة: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. تُزامن كل مصدر أسبوعياً؛ الصيغة الدقيقة على صفحة المنهجية.