Pertanyaan yang sering diajukan

Semua yang perlu Anda ketahui tentang peringkat, metodologi, dan data LLMPodium.

Setiap model mendapat Podium Score (0–100): 35% Elo arena, 30% rata-rata benchmark, 20% Intelligence Index dari Artificial Analysis, dan 15% LLM Stats — dinormalisasi dan digabung dari lima papan peringkat independen.

Kami menyinkronkan kelima sumber tiap minggu. Rilis model besar memicu pembaruan seketika. Setiap halaman menampilkan tanggal pembaruan terakhir.

Kami menggabungkan lima papan peringkat publik: Arena.ai (Elo arena), Artificial Analysis (intelligence index dan kinerja), LLM Stats, Vellum, dan LLMBase. Harga diambil dari dokumentasi penyedia.

Podium Score adalah rata-rata berbobot dari empat sinyal ternormalisasi: Elo arena (35%), rata-rata benchmark (30%), Intelligence Index (20%), dan LLM Stats (15%). Sinyal yang hilang didistribusikan ulang ke sumber lain. Detail di halaman metodologi.

Tidak semua model diuji pada setiap benchmark — sebagian butuh kemampuan khusus (misalnya visi untuk MMMU) atau belum dijalankan pada model terbaru. Kami menampilkan “—” untuk data yang tidak tersedia.

Bisa! Buka halaman perbandingan, pilih hingga 4 model, dan lihat perbandingan rinci semua metrik: benchmark, harga, kecepatan, dan latensi.

Arena Elo adalah peringkat preferensi berdasar suara manusia: dua model anonim menjawab prompt yang sama, orang memilih, dan suara memperbarui peringkat Elo dengan interval kepercayaan. Ini sinyal terbesar dalam peringkat kami.

Kami menampilkan harga token input dan output per juta, diambil langsung dari halaman harga API resmi tiap penyedia. Kategori Nilai menggabungkan keduanya — semakin rendah semakin baik.

Tentu. Kami memantau model proprietari maupun berbobot terbuka: DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu, dan lainnya. Model berbobot terbuka punya papan peringkat sendiri di /leaderboard/open.

TTFT mengukur waktu dari pengiriman prompt hingga token respons pertama diterima. Semakin rendah semakin baik. Ini metrik kunci untuk aplikasi interaktif yang mengutamakan responsif.

Data papan peringkat berasal dari benchmark publik. Periksa lisensi tiap benchmark untuk ketentuan penggunaan. Ringkasan yang dapat dibaca mesin tersedia di /llms.txt.

Ketika penyedia memperbarui model, kami memperbarui entri yang ada atau membuat yang baru tergantung signifikansi perubahan. Model yang dihentikan mempertahankan hasil terakhir dan diberi label “lawas”.