คำศัพท์ LLM

แนวคิดหลักที่คุณจะพบเมื่ออ่านตารางอันดับ แต่ละคำมีคำอธิบายสั้นและลิงก์ไปหน้าที่เกี่ยวข้อง

Podium Score

คะแนนอันดับรวม 0–100 ของ LLMPodium: 0.35·Arena Elo + 0.30·ค่าเฉลี่ยเบนช์มาร์ก + 0.20·ดัชนีความฉลาด + 0.15·LLM Stats ปรับ min-max และถ่วงน้ำหนักใหม่เมื่อสัญญาณขาด — ดูข้อมูลสด

Elo

ระบบคะแนนจากหมากรุก ในอารีนา LLM โมเดลได้ Elo จากการชนะการประลองที่มนุษย์เลือก ส่วนต่างของ Elo สองตัวทำนายความน่าจะเป็นชนะ — ดูข้อมูลสด

เบนช์มาร์ก

ชุดทดสอบมาตรฐานที่มีงานให้คะแนน (คณิต โค้ด วิทยาศาสตร์) เพื่อวัดความสามารถเฉพาะของโมเดลภายใต้เงื่อนไขที่เทียบกันได้ — ดูข้อมูลสด

โทเคน

ชิ้นคำย่อยที่ LLM อ่านและเขียน อังกฤษประมาณ 1 โทเคน ≈ 4 ตัวอักษร ราคาอ้างอิงต่อล้าน (M) โทเคน

หน้าต่างบริบท

ปริมาณข้อความสูงสุด (เป็นโทเคน) ที่โมเดลพิจารณาได้พร้อมกัน — พร้อมพ์ตบวกคำตอบ โมเดล frontier ปี 2026 อยู่ในช่วง 128K ถึง 1M โทเคน — ดูข้อมูลสด

TTFT (เวลาถึงโทเคนแรก)

ความหน่วงก่อนโทเคนเอาต์พุตแรกมาถึง เป็นตัวกำหนดความรู้สึกตอบสนองในแชต วัดเป็นมิลลิวินาที — ดูข้อมูลสด

อัตราเอาต์พุต (tokens/s)

จำนวนโทเคนที่โมเดลสร้างต่อวินาทีหลังโทเคนแรก กำหนดความเร็วของคำตอบยาว — ดูข้อมูลสด

Mixture of Experts (MoE)

สถาปัตยกรรมที่เปิดใช้พารามิเตอร์บางส่วน ("experts") ต่อโทเคน ได้ความรู้ขนาดใหญ่ในต้นทุนอนุมานต่ำ เช่น Qwen3.8 Max, DeepSeek V4 — ดูข้อมูลสด

โอเพนเวต

โมเดลที่เปิดเผยน้ำหนักให้โฮสต์เองและไฟน์จูนได้ (Kimi K3, GLM-5.2, Llama 4) ต่างจากโมเดลปิดที่ใช้ผ่าน API เท่านั้น — ดูข้อมูลสด

โมเดลเหตุผล

โมเดลที่ฝึกให้ใช้โทเคน "คิด" เพิ่มก่อนตอบ แลกความหน่วงกับความแม่นยำในปัญหายาก (GPQA, HLE, คณิตโอลิมปิก) — ดูข้อมูลสด

ฮัลลูซิเนชัน

ข้อความมั่นใจแต่ไม่มีหลักฐานรองรับ เบนช์มาร์กข้อเท็จจริงอย่าง SimpleQA วัดความถี่ที่โมเดลหลีกเลี่ยง — ดูข้อมูลสด

SWE-Bench Verified

การแก้ปัญหา GitHub issue จริงใน repo จริง ตรวจสอบโดยมนุษย์ เป็นเบนช์มาร์กมาตรฐานของ software engineering แบบ agent — ดูข้อมูลสด

GPQA Diamond

คำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาที่ผู้เชี่ยวชาญเขียนและกันการค้นหาคำตอบ เป็นเบนช์มาร์กเหตุผลหลัก — ดูข้อมูลสด

Humanity's Last Exam

ชุดคำถามที่ผู้เชี่ยวชาญเขียนให้อยู่ริมขอบความรู้ของมนุษย์ โมเดล frontier ปัจจุบันยังทำได้ 40–60% — ดูข้อมูลสด

MMLU-Pro

รุ่นต่อจาก MMLU ที่ยากขึ้น มี 14 หมวด วัดความรู้เชิงวิชาการกว้างด้วยตัวเลือกที่ยากขึ้น — ดูข้อมูลสด

Min-max normalization

การปรับมาตรวัดดิบใด ๆ เป็น 0–100 ทั้งชุดโมเดลที่ติดตาม เพื่อให้คะแนนคนละแหล่งผสมกันได้ 80 หมายถึง "80% ของทางจากแย่สุดไปดีสุด" เสมอ — ดูข้อมูลสด

ช่วงความเชื่อมั่น (±CI)

ความไม่แน่นอนทางสถิติของ Elo ในอารีนา ช่วงซ้อนกันแปลว่าสองโมเดลเสมอกันในทางปฏิบัติ — ดูข้อมูลสด

$/M โทเคน

ราคาต่อล้านโทเคน แยกอินพุตและเอาต์พุต โทเคนเอาต์พุตมักแพงกว่าอินพุต 3–5 เท่า — ดูข้อมูลสด