مسرد LLM

المفاهيم الأساسية التي ستقابلها عند قراءة التصنيفات. كل مصطلح مع شرح موجز ورابط إلى الصفحة ذات الصلة.

Podium Score

درجة LLMPodium المركبة من 0 إلى 100: ‏0.35·Elo الأرينا + 0.30·متوسط الاختبارات + 0.20·مؤشر الذكاء + 0.15·LLM Stats، مع تسوية min-max وإعادة توزيع الإشارات المفقودة. — شاهد البيانات الحية

تصنيف Elo

نظام تقييم مأخوذ من الشطرنج. في أرينات LLM تكسب النماذج Elo بفوزها في مواجهات تفضيل بشرية مباشرة؛ والفرق بين Elo لنموذجين يتنبأ باحتمال الفوز. — شاهد البيانات الحية

اختبار قياس (Benchmark)

مجموعة اختبارات موحدة بمهام مُقيَّمة (رياضيات، برمجة، علوم) لقياس قدرة محددة للنموذج في ظروف قابلة للمقارنة. — شاهد البيانات الحية

الرموز (Tokens)

الوحدات اللفظية الفرعية التي تقرأها نماذج LLM وتكتبها. تقريباً 1 رمز ≈ 4 أحرف إنجليزية، والرمز العربي نحو 1–2 رمز. الأسعار تُذكر لكل مليون (M) رمز.

نافذة السياق

أقصى كمية نص (بالرموز) يستطيع النموذج اعتبارها دفعة واحدة — المُدخل مع الإجابة. نماذج الطليعة في 2026 تتراوح بين 128K و1M رمز. — شاهد البيانات الحية

TTFT (الزمن حتى أول رمز)

زمن الاستجابة قبل وصول أول رمز مُخرج. يهيمن على الإحساس بالسرعة في الدردشة؛ ويُقاس بالمللي ثانية. — شاهد البيانات الحية

معدل الإخراج (رمز/ثانية)

كم رمزاً في الثانية يولّد النموذج بعد الرمز الأول. يحدد سرعة تدفق الإجابات الطويلة. — شاهد البيانات الحية

مزيج الخبراء (MoE)

بنية يُفعَّل فيها جزء فقط من المعاملات («خبراء») لكل رمز، فتعطي معرفة كبيرة بكلفة استدلال منخفضة — مثل Qwen3.8 Max أو DeepSeek V4. — شاهد البيانات الحية

الأوزان المفتوحة

نماذج تُنشر معاملاتها المدرَّبة للعامة، ما يتيح الاستضافة الذاتية والضبط الدقيق (Kimi K3 وGLM-5.2 وLlama 4)، خلافاً للنماذج المملوكة عبر API فقط. — شاهد البيانات الحية

نموذج الاستدلال

نموذج مُدرَّب على إنفاق رموز «تفكير» إضافية قبل الإجابة، فيقايض زمن الاستجابة بالدقة في المسائل الصعبة (GPQA وHLE ورياضيات الأولمبياد). — شاهد البيانات الحية

الهلوسة

ادعاء واثق لكنه بلا سند. اختبارات الوقائعية مثل SimpleQA تقيس مدى تجنّب النماذج لها. — شاهد البيانات الحية

SWE-Bench Verified

حل مشاكل GitHub حقيقية في مستودعات حقيقية مع تحقق بشري. الاختبار القياسي لهندسة البرمجيات الوكيلة. — شاهد البيانات الحية

GPQA Diamond

أسئلة علمية بمستوى الدراسات العليا يكتبها خبراء وتصعب على محركات البحث؛ اختبار جوهري للاستدلال. — شاهد البيانات الحية

Humanity's Last Exam

مجموعة أسئلة وضعها خبراء عند حدود المعرفة البشرية؛ نماذج الطليعة الحالية لا تزال تسجل 40–60%. — شاهد البيانات الحية

MMLU-Pro

الخليق الأصعب لـMMLU: ‏14 فئة وخيارات أصعب لقياس معرفة أكاديمية واسعة. — شاهد البيانات الحية

التسوية min-max

إعادة قياس أي مقياس خام إلى 0–100 عبر جميع النماذج المتتبعة كي يمكن مزج درجات من مصادر مختلفة. ‏80 تعني دائماً «80% من الطريق بين الأسوأ والأفضل». — شاهد البيانات الحية

فاصل الثقة (±CI)

اللايقين الإحصائي لـElo الأرينا. تداخل الفواصل يعني أن النموذجين متعادلان عملياً. — شاهد البيانات الحية

$/M رمز

السعر لكل مليون رمز، ويُذكر منفصلاً للإدخال والإخراج. رموز الإخراج عادة أغلى 3–5 أضعاف من الإدخال. — شاهد البيانات الحية