Glosarium LLM
Konsep inti yang akan Anda temui saat membaca peringkat. Setiap istilah disertai penjelasan singkat dan tautan ke halaman terkait.
Podium Score
Skor gabungan 0–100 LLMPodium: 0.35·Elo arena + 0.30·rata-rata benchmark + 0.20·Indeks Inteligensi + 0.15·LLM Stats, dinormalisasi min-max dengan pemberatan ulang sinyal yang hilang. — lihat data langsung
Rating Elo
Sistem penilaian yang dipinjam dari catur. Di arena LLM, model memperoleh Elo dengan memenangkan duel preferensi manusia; selisih dua Elo memprediksi probabilitas menang. — lihat data langsung
Benchmark
Serangkaian tes terstandar dengan tugas bernilai (matematika, coding, sains) untuk mengukur kemampuan spesifik model dalam kondisi yang dapat dibandingkan. — lihat data langsung
Token
Potongan sub-kata yang dibaca dan ditulis LLM. Sekitar 1 token ≈ 4 karakter teks Inggris; harga dikutip per juta (M) token.
Jendela konteks
Jumlah teks maksimum (dalam token) yang dapat dipertimbangkan model sekaligus — prompt ditambah jawaban. Model frontier 2026 berkisar 128K hingga 1M token. — lihat data langsung
TTFT (waktu ke token pertama)
Latensi sampai token output pertama tiba. Mendominasi rasa responsif di chat; diukur dalam milidetik. — lihat data langsung
Throughput output (token/detik)
Berapa token per detik yang dihasilkan model setelah token pertama. Menentukan kecepatan jawaban panjang. — lihat data langsung
Mixture of Experts (MoE)
Arsitektur di mana hanya sebagian parameter («pakar») yang aktif per token: pengetahuan besar dengan biaya inferensi kecil — misalnya Qwen3.8 Max atau DeepSeek V4. — lihat data langsung
Bobot terbuka
Model yang parameter terlatihnya dipublikasikan, sehingga dapat dihosting sendiri dan difine-tuning (Kimi K3, GLM-5.2, Llama 4). Kebalikan dari model proprietar hanya-API. — lihat data langsung
Model penalaran
Model yang dilatih memakai token «berpikir» ekstra sebelum menjawab: menukar latensi dengan akurasi pada soal sulit (GPQA, HLE, matematika kompetisi). — lihat data langsung
Halusinasi
Pernyataan meyakinkan tapi tak berdasar. Benchmark faktualitas seperti SimpleQA mengukur seberapa sering model menghindarinya. — lihat data langsung
SWE-Bench Verified
Menyelesaikan issue GitHub nyata di repositori nyata, diverifikasi manusia. Benchmark standar rekayasa perangkat lunak agentik. — lihat data langsung
GPQA Diamond
Pertanyaan sains level pascasarjana yang ditulis pakar dan «tahan pencarian»; benchmark penalaran inti. — lihat data langsung
Humanity's Last Exam
Kumpulan soal buatan pakar di batas pengetahuan manusia; model frontier saat ini masih meraih 40–60%. — lihat data langsung
MMLU-Pro
Penerus MMLU yang lebih keras: 14 kategori dengan pilihan jawaban lebih sulit untuk mengukur pengetahuan akademik luas. — lihat data langsung
Normalisasi min-max
Menskala ulang metrik mentah apa pun ke 0–100 di seluruh model yang dilacak, agar skor dari sumber berbeda dapat dicampur. 80 selalu berarti «80% jarak dari terburuk ke terbaik». — lihat data langsung
Interval kepercayaan (±CI)
Ketidakpastian statistik Elo arena. Interval yang tumpang tindih berarti dua model praktis seri. — lihat data langsung
$/M token
Harga per juta token, dikutip terpisah untuk input dan output. Token output biasanya 3–5× lebih mahal daripada input. — lihat data langsung