مسرد LLM
المفاهيم الأساسية التي ستقابلها عند قراءة التصنيفات. كل مصطلح مع شرح موجز ورابط إلى الصفحة ذات الصلة.
Podium Score
درجة LLMPodium المركبة من 0 إلى 100: 0.35·Elo الأرينا + 0.30·متوسط الاختبارات + 0.20·مؤشر الذكاء + 0.15·LLM Stats، مع تسوية min-max وإعادة توزيع الإشارات المفقودة. — شاهد البيانات الحية
تصنيف Elo
نظام تقييم مأخوذ من الشطرنج. في أرينات LLM تكسب النماذج Elo بفوزها في مواجهات تفضيل بشرية مباشرة؛ والفرق بين Elo لنموذجين يتنبأ باحتمال الفوز. — شاهد البيانات الحية
اختبار قياس (Benchmark)
مجموعة اختبارات موحدة بمهام مُقيَّمة (رياضيات، برمجة، علوم) لقياس قدرة محددة للنموذج في ظروف قابلة للمقارنة. — شاهد البيانات الحية
الرموز (Tokens)
الوحدات اللفظية الفرعية التي تقرأها نماذج LLM وتكتبها. تقريباً 1 رمز ≈ 4 أحرف إنجليزية، والرمز العربي نحو 1–2 رمز. الأسعار تُذكر لكل مليون (M) رمز.
نافذة السياق
أقصى كمية نص (بالرموز) يستطيع النموذج اعتبارها دفعة واحدة — المُدخل مع الإجابة. نماذج الطليعة في 2026 تتراوح بين 128K و1M رمز. — شاهد البيانات الحية
TTFT (الزمن حتى أول رمز)
زمن الاستجابة قبل وصول أول رمز مُخرج. يهيمن على الإحساس بالسرعة في الدردشة؛ ويُقاس بالمللي ثانية. — شاهد البيانات الحية
معدل الإخراج (رمز/ثانية)
كم رمزاً في الثانية يولّد النموذج بعد الرمز الأول. يحدد سرعة تدفق الإجابات الطويلة. — شاهد البيانات الحية
مزيج الخبراء (MoE)
بنية يُفعَّل فيها جزء فقط من المعاملات («خبراء») لكل رمز، فتعطي معرفة كبيرة بكلفة استدلال منخفضة — مثل Qwen3.8 Max أو DeepSeek V4. — شاهد البيانات الحية
الأوزان المفتوحة
نماذج تُنشر معاملاتها المدرَّبة للعامة، ما يتيح الاستضافة الذاتية والضبط الدقيق (Kimi K3 وGLM-5.2 وLlama 4)، خلافاً للنماذج المملوكة عبر API فقط. — شاهد البيانات الحية
نموذج الاستدلال
نموذج مُدرَّب على إنفاق رموز «تفكير» إضافية قبل الإجابة، فيقايض زمن الاستجابة بالدقة في المسائل الصعبة (GPQA وHLE ورياضيات الأولمبياد). — شاهد البيانات الحية
الهلوسة
ادعاء واثق لكنه بلا سند. اختبارات الوقائعية مثل SimpleQA تقيس مدى تجنّب النماذج لها. — شاهد البيانات الحية
SWE-Bench Verified
حل مشاكل GitHub حقيقية في مستودعات حقيقية مع تحقق بشري. الاختبار القياسي لهندسة البرمجيات الوكيلة. — شاهد البيانات الحية
GPQA Diamond
أسئلة علمية بمستوى الدراسات العليا يكتبها خبراء وتصعب على محركات البحث؛ اختبار جوهري للاستدلال. — شاهد البيانات الحية
Humanity's Last Exam
مجموعة أسئلة وضعها خبراء عند حدود المعرفة البشرية؛ نماذج الطليعة الحالية لا تزال تسجل 40–60%. — شاهد البيانات الحية
MMLU-Pro
الخليق الأصعب لـMMLU: 14 فئة وخيارات أصعب لقياس معرفة أكاديمية واسعة. — شاهد البيانات الحية
التسوية min-max
إعادة قياس أي مقياس خام إلى 0–100 عبر جميع النماذج المتتبعة كي يمكن مزج درجات من مصادر مختلفة. 80 تعني دائماً «80% من الطريق بين الأسوأ والأفضل». — شاهد البيانات الحية
فاصل الثقة (±CI)
اللايقين الإحصائي لـElo الأرينا. تداخل الفواصل يعني أن النموذجين متعادلان عملياً. — شاهد البيانات الحية
$/M رمز
السعر لكل مليون رمز، ويُذكر منفصلاً للإدخال والإخراج. رموز الإخراج عادة أغلى 3–5 أضعاف من الإدخال. — شاهد البيانات الحية