Peringkat LLM · Diperbarui 5 Agu 2026

The Definitive
LLM Leaderboard.

Membandingkan 673 model bahasa pada 25 benchmark, suara arena, harga, dan kecepatan — menggabungkan lima papan peringkat independen.

Digabungkan dari 5 papan peringkat independen:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
llmpodium eval --benchmark suite
$llmpodium compare claude-mythos-preview vs claude-fable-5
EvaluatingRunning SWE-Bench, AIME, GPQA & Arena Elo...
Claude Mythos Preview: Score 97.4 · 80 t/s · Rank #1
Claude Fable 5: Score 93.4 · 71 t/s · 1509 Elo
Podium VerdictClaude Mythos Preview leads overall composite index
$
Tracked AI Labs
OpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaiduOpenAIAnthropicGoogle DeepMindMeta AIxAIDeepSeekMistral AIMoonshot AIAlibaba CloudCohereMicrosoftAmazonZhipu AIBaidu
673+
Model
Flagship curated
25
Benchmark
Rigorous evals
44
Penyedia
Global AI labs
719
Model di arena
Human battle Elo
01 · Real-Time Rankings

Model teratas

Lihat semua →

Top 10 Models by Overall Podium Score

Lihat semua →
#ModelPodium ScoreElo arenaCodingKecepatanHarga (output)
01
Claude Mythos Preview
Anthropic · Proprietary
97.4
80.980 t/s$15/M
02
Claude Fable 5
Anthropic · Proprietary
93.4
150984.171 t/s$50/M
03
Kimi K3
Moonshot AI · Open Weights
83.3
148561.537 t/s$15/M
4
Claude Opus 5
Anthropic · Proprietary
81.4
149270.460 t/s$25/M
5
GPT-5.6 Sol
OpenAI · Proprietary
80.8
148364.872 t/s$30/M
6
Qwen3.8 Max
Alibaba · Proprietary
79.8
149650.355 t/s$2/M
7
Claude Opus 4.8
Anthropic · Proprietary
76.0
148458.050 t/s$15/M
8
Claude Opus 4 6 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
9
Claude Opus 4 7 Thinking
Anthropic · Unknown
75.0
50 t/s$15/M
10
Claude Opus 5 Max
Anthropic · Unknown
75.0
50 t/s$15/M
02 · Evaluation Domains

Terbaik per tugas

Lihat semua →
03 · Research & Analysis

Artikel terbaru

Semua artikel

Open LLM Intelligence Platform

Find the perfect model for your workflow.

Compare accuracy, price-per-token, latency, and real-world agent performance across 700+ language models in seconds.

04 · FAQ

Pertanyaan umum

Semua FAQ
Setiap model mendapat Podium Score (0–100) — campuran berbobot dari empat sinyal: 35% Elo arena dari perbandingan oleh manusia, 30% rata-rata benchmark, 20% Intelligence Index dari Artificial Analysis, dan 15% skor LLM Stats. Semua sinyal dinormalisasi ke skala umum, sehingga skornya menjadi jalan tengah yang masuk akal dari lima papan peringkat independen.
Claude Mythos Preview memimpin dengan 97.4. Berikutnya Claude Fable 5 (93.4) dan Kimi K3 (83.3). Peringkat berubah tiap minggu seiring masuknya suara dan hasil baru.
Kami mengkurasi 673 model unggulan dalam 18 kategori (coding, matematika, penalaran, agen, pengetahuan, multimodal, konteks panjang, kecepatan, nilai, dan bobot terbuka), ditambah tabel arena lengkap berisi 719 model.
Dari lima papan peringkat publik: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Setiap sumber disinkronkan tiap minggu; formula lengkapnya ada di halaman metodologi.