لقطة لمشهد النماذج حتى أغسطس 2026، مستقاة بالكامل من البيانات خلف تصنيفنا — 58 نموذجاً متتبعاً، 25 اختباراً، وخمسة تصنيفات مصدرية.
قمة المنصة
يحافظ Claude Mythos Preview على المركز الأول عند 97.4، يليه Claude Fable 5 (93.4) و— النموذج الوحيد غير التابع لـAnthropic على المنصة — Kimi K3 (83.3)، وهو أيضاً أفضل نموذج بالأوزان المفتوحة نتتبعه. تحتل Anthropic أربعة من المراكز الخمسة الأولى.
فجوة الأوزان المفتوحة: 14 نقطة وتتقلص
يقع 83.3 الخاص بـKimi K3 نحو 14 نقطة Podium دون الجبهة المملوكة. في LiveCodeBench يتفوق على عدة نماذج مغلقة تكلف عشرة أضعاف. بعد أفضل ثلاثة نماذج مفتوحة، تهبط الدرجات دون 50 — المجال المفتوح حالياً بعمق مختبر واحد على الجبهة.
الأسعار: فارق 178×
تتراوح أسعار الإخراج بين $0.28/M (DeepSeek V4 Flash) و$50/M (Claude Fable 5). تقسم السوق إلى ثلاثة مستويات: خدمي (<$1/M)، عمل ($1–10/M) وريادي ($25–50/M). يظهر تصنيف القيمة أن نقطة الذكاء لكل دولار المثلى في مستوى العمل.
السرعة: حروب فلاش
تمتلك عائلة Flash من Google منصة السرعة — Gemini 3.5 Flash-Lite عند 389 رمزاً/ثانية — بينما Muse Spark 1.1 من Meta (208 رموز/ث عند $4.25/M) هو أفضل قصة سرعة مقابل دولار هذا العام.
ما الذي حسم 2026
حلّت الاختبارات الوكيلة محل تفضيل الدردشة كساحة معركة: ميّز SWE-Bench Verified (Fable 5 عند 95%) وTerminal-Bench المتصدرين، بينما يبقى Humanity's Last Exam سقف الجبهة — لا أحد يتجاوزه بأريحية. استكشف أي مواجهة في صفحات المواجهة المباشرة الجديدة.