كيف نقيّم

يجمع Podium Score خمس لوحات صدارة مستقلة في رقم واحد قابل للمقارنة.

صيغة Podium Score

Podium Score = 0.35·الأرينا + 0.30·الاختبارات + 0.20·الذكاء + 0.15·LLM Stats

  • Arena (35%) — تقييم Elo من تصويت المستخدمين المزدوج (Arena.ai، 719 نموذجاً، مرجّح بالأصوات، مع فترات ثقة).
  • Benchmarks (30%) — متوسط جميع نتائج الاختبارات المسوّاة التي نتتبعها للنموذج (25 اختباراً إجمالاً).
  • Intelligence Index (20%) — مؤشر الذكاء المركب من Artificial Analysis.
  • LLM Stats (15%) — الدرجة المركبة المنشورة من llm-stats.com.

عندما لا يملك مصدر قيمة لنموذج ما، يُعاد توزيع وزنه تناسبياً على المصادر الأخرى — لا يُعاقَب النموذج أبداً لغيابه عن لوحة صدارة واحدة.

التسوية

تُسوَّى كل إشارة بطريقة min-max إلى مقياس 0–100 عبر جميع النماذج الـ673 المتتبعة، لذا يعني 80 دائماً "80% من المسافة بين أسوأ وأفضل نموذج مُلاحظ". تُستخدم الاختبارات النسبية كما هي؛ ويُسوَّى Elo والمؤشرات والأسعار حسب نطاقاتها.

درجات الفئات

إلى جانب الترتيب العام، ندير 17 لوحة صدارة للفئات، كل واحدة مبنية على الاختبارات الأكثر صلة بالمهمة:

  • Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
  • Math — AIME 2025, FrontierMath, MATH.
  • Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
  • Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
  • Knowledge — SimpleQA, MMLU-Pro, MMMLU.
  • Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
  • Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
  • Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
  • Multilingual — Multilingual MMLU.
  • Writing — IFBench, Arena Elo.
  • Chat & Assistants — Arena Elo, IFBench.
  • Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
  • Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
  • Long Context — MRCR v2, Context window.
  • Speed — Output tokens/s.
  • Value — Blended price /1M, Cost per task.
  • Open Weights — Podium Score.

مصادر البيانات

تُجمَع كل البيانات من خمس لوحات صدارة عامة:

وتيرة التحديث

نزامن جميع المصادر أسبوعياً؛ الإصدارات الكبيرة للنماذج تحفّز تحديثاً فورياً. آخر تحديث كامل: 2026-08-05.

القيود

لا يوجد اختبار مثالي، وتفضيلات الأرينا لا تعادل الملاءمة للمهام. لقرارات سيناريوهات محددة، استخدم لوحات صدارة الفئات وأداة المقارنة. النماذج بوضع المعاينة مميزة وقد تتحرك مع وصول أصوات ونتائج جديدة.