Glosarium LLM

Konsep inti yang akan Anda temui saat membaca peringkat. Setiap istilah disertai penjelasan singkat dan tautan ke halaman terkait.

Podium Score

Skor gabungan 0–100 LLMPodium: 0.35·Elo arena + 0.30·rata-rata benchmark + 0.20·Indeks Inteligensi + 0.15·LLM Stats, dinormalisasi min-max dengan pemberatan ulang sinyal yang hilang. — lihat data langsung

Rating Elo

Sistem penilaian yang dipinjam dari catur. Di arena LLM, model memperoleh Elo dengan memenangkan duel preferensi manusia; selisih dua Elo memprediksi probabilitas menang. — lihat data langsung

Benchmark

Serangkaian tes terstandar dengan tugas bernilai (matematika, coding, sains) untuk mengukur kemampuan spesifik model dalam kondisi yang dapat dibandingkan. — lihat data langsung

Token

Potongan sub-kata yang dibaca dan ditulis LLM. Sekitar 1 token ≈ 4 karakter teks Inggris; harga dikutip per juta (M) token.

Jendela konteks

Jumlah teks maksimum (dalam token) yang dapat dipertimbangkan model sekaligus — prompt ditambah jawaban. Model frontier 2026 berkisar 128K hingga 1M token. — lihat data langsung

TTFT (waktu ke token pertama)

Latensi sampai token output pertama tiba. Mendominasi rasa responsif di chat; diukur dalam milidetik. — lihat data langsung

Throughput output (token/detik)

Berapa token per detik yang dihasilkan model setelah token pertama. Menentukan kecepatan jawaban panjang. — lihat data langsung

Mixture of Experts (MoE)

Arsitektur di mana hanya sebagian parameter («pakar») yang aktif per token: pengetahuan besar dengan biaya inferensi kecil — misalnya Qwen3.8 Max atau DeepSeek V4. — lihat data langsung

Bobot terbuka

Model yang parameter terlatihnya dipublikasikan, sehingga dapat dihosting sendiri dan difine-tuning (Kimi K3, GLM-5.2, Llama 4). Kebalikan dari model proprietar hanya-API. — lihat data langsung

Model penalaran

Model yang dilatih memakai token «berpikir» ekstra sebelum menjawab: menukar latensi dengan akurasi pada soal sulit (GPQA, HLE, matematika kompetisi). — lihat data langsung

Halusinasi

Pernyataan meyakinkan tapi tak berdasar. Benchmark faktualitas seperti SimpleQA mengukur seberapa sering model menghindarinya. — lihat data langsung

SWE-Bench Verified

Menyelesaikan issue GitHub nyata di repositori nyata, diverifikasi manusia. Benchmark standar rekayasa perangkat lunak agentik. — lihat data langsung

GPQA Diamond

Pertanyaan sains level pascasarjana yang ditulis pakar dan «tahan pencarian»; benchmark penalaran inti. — lihat data langsung

Humanity's Last Exam

Kumpulan soal buatan pakar di batas pengetahuan manusia; model frontier saat ini masih meraih 40–60%. — lihat data langsung

MMLU-Pro

Penerus MMLU yang lebih keras: 14 kategori dengan pilihan jawaban lebih sulit untuk mengukur pengetahuan akademik luas. — lihat data langsung

Normalisasi min-max

Menskala ulang metrik mentah apa pun ke 0–100 di seluruh model yang dilacak, agar skor dari sumber berbeda dapat dicampur. 80 selalu berarti «80% jarak dari terburuk ke terbaik». — lihat data langsung

Interval kepercayaan (±CI)

Ketidakpastian statistik Elo arena. Interval yang tumpang tindih berarti dua model praktis seri. — lihat data langsung

$/M token

Harga per juta token, dikutip terpisah untuk input dan output. Token output biasanya 3–5× lebih mahal daripada input. — lihat data langsung