Cara kami menilai

Podium Score menggabungkan lima papan peringkat independen menjadi satu angka yang dapat dibandingkan.

Formula Podium Score

Podium Score = 0.35·Arena + 0.30·Benchmark + 0.20·Inteligensi + 0.15·LLM Stats

  • Arena (35%) — Peringkat Elo dari pemungutan suara pasangan pengguna (Arena.ai, 719 model, berbobot suara, dengan interval kepercayaan).
  • Benchmarks (30%) — rata-rata semua hasil benchmark ternormalisasi yang kami pantau untuk model tersebut (25 benchmark total).
  • Intelligence Index (20%) — indeks inteligensi komposit dari Artificial Analysis.
  • LLM Stats (15%) — skor komposit yang diterbitkan llm-stats.com.

Ketika sebuah sumber tidak memiliki nilai untuk suatu model, bobotnya didistribusikan ulang secara proporsional ke sumber lain — model tidak pernah dihukum karena absen dari satu papan peringkat.

Normalisasi

Setiap sinyal dinormalisasi min-max ke skala 0–100 di seluruh 673 model yang dipantau, jadi 80 selalu berarti "80% jarak antara model terburuk dan terbaik yang teramati". Benchmark persentase dipakai apa adanya; Elo, indeks, dan harga dinormalisasi sesuai rentangnya.

Skor kategori

Selain peringkat keseluruhan, kami mengelola 17 papan peringkat kategori, masing-masing dibangun dari benchmark yang paling relevan untuk tugasnya:

  • Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
  • Math — AIME 2025, FrontierMath, MATH.
  • Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
  • Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
  • Knowledge — SimpleQA, MMLU-Pro, MMMLU.
  • Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
  • Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
  • Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
  • Multilingual — Multilingual MMLU.
  • Writing — IFBench, Arena Elo.
  • Chat & Assistants — Arena Elo, IFBench.
  • Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
  • Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
  • Long Context — MRCR v2, Context window.
  • Speed — Output tokens/s.
  • Value — Blended price /1M, Cost per task.
  • Open Weights — Podium Score.

Sumber data

Semua data digabungkan dari lima papan peringkat publik:

Frekuensi pembaruan

Kami menyinkronkan semua sumber tiap minggu; rilis model besar memicu pembaruan seketika. Pembaruan lengkap terakhir: 2026-08-05.

Keterbatasan

Tidak ada benchmark yang sempurna, dan preferensi arena tidak sama dengan kecocokan tugas. Untuk keputusan skenario spesifik, gunakan papan peringkat kategori dan alat perbandingan. Model berstatus pratinjau ditandai dan dapat bergeser seiring masuknya suara dan hasil baru.