ภาพรวมภูมิทัศน์โมเดล ณ สิงหาคม 2026 ดึงจากข้อมูลเบื้องหลัง อันดับ ของเราทั้งหมด — โมเดลที่ติดตาม 58 ตัว เบนช์มาร์ก 25 รายการ และลีดเดอร์บอร์ดต้นทาง 5 แห่ง
ยอดโพเดียม
Claude Mythos Preview ครองอันดับ 1 ที่ 97.4 ตามด้วย Claude Fable 5 (93.4) และ — โมเดลเดียวที่ไม่ใช่ Anthropic บนโพเดียม — Kimi K3 (83.3) ซึ่งเป็นโมเดลโอเพนเวตที่ดีที่สุดที่เราติดตามด้วย Anthropic กินพื้นที่ 4 จาก 5 อันดับแรก
ช่องว่างโอเพนเวต: 14 คะแนน และกำลังแคบลง
คะแนน 83.3 ของ Kimi K3 อยู่ต่ำกว่า frontier ฝั่งปิดราว 14 คะแนน Podium ใน LiveCodeBench มันชนะโมเดลปิดหลายตัวที่แพงกว่าสิบเท่า อย่างไรก็ตาม หลังท็อป 3 ของฝั่งเปิด คะแนนร่วงต่ำกว่า 50 — สนามเปิดตอนนี้นึกเพียงหนึ่งแล็บในระดับ frontier
ราคา: ช่วงห่าง 178 เท่า
ราคาเอาต์พุตอยู่ระหว่าง $0.28/M (DeepSeek V4 Flash) ถึง $50/M (Claude Fable 5) ตลาดแบ่งเป็นสามขั้น: ใช้งานทั่วไป (<$1/M), ทำงานหลัก ($1–10/M) และ frontier ($25–50/M) อันดับคุณค่า แสดงว่าจุดคุ้มความฉลาดต่อดอลลาร์อยู่ขั้นทำงานหลัก
ความเร็ว: สงคราม flash
ตระกูล Flash ของ Google ครอง โพเดียมความเร็ว — Gemini 3.5 Flash-Lite ที่ 389 โทเคน/วินาที — ขณะ Muse Spark 1.1 ของ Meta (208 t/s ที่ $4.25/M) คือเรื่องราวความเร็วต่อดอลลาร์ที่ดีที่สุดของปี
อะไรชี้ขาดปี 2026
เบนช์มาร์กเชิงเอเจนต์เข้ามาแทนที่ความชอบแชทในฐานะสนามรบ: SWE-Bench Verified (Fable 5 ที่ 95%) และ Terminal-Bench แยกผู้นำออกจากกัน ส่วน Humanity's Last Exam ยังเป็นเพดานของ frontier — ไม่มีใครผ่านได้สบาย ๆ สำรวจการประกบคู่ใดก็ได้ใน หน้าประกบคู่ ใหม่