الأسئلة الشائعة
كل ما تحتاج معرفته عن ترتيبات LLMPodium ومنهجيته وبياناته.
يحصل كل نموذج على Podium Score (0–100): 35% Elo الأرينا، 30% متوسط الاختبارات، 20% مؤشر الذكاء من Artificial Analysis و15% LLM Stats — مسوّاة ومدمجة من خمس لوحات صدارة مستقلة.
نزامن المصادر الخمسة أسبوعياً. الإصدارات الكبيرة للنماذج تحفّز تحديثاً فورياً. تعرض كل صفحة تاريخ آخر تحديث.
نجمع خمس لوحات صدارة عامة: Arena.ai (Elo الأرينا)، Artificial Analysis (مؤشر الذكاء والأداء)، LLM Stats، Vellum وLLMBase. الأسعار من وثائق المزوّدين.
Podium Score متوسط مرجّح لأربع إشارات مسوّاة: Elo الأرينا (35%)، متوسط الاختبارات (30%)، مؤشر الذكاء (20%) وLLM Stats (15%). تُعاد توزيع الإشارات المفقودة على المصادر الأخرى. التفاصيل في صفحة المنهجية.
لا تُختبَر جميع النماذج على كل اختبار — بعضها يتطلب قدرات خاصة (كالرؤية لـMMMU) أو لم يُشغَّل بعد على النماذج الأحدث. نعرض "—" للبيانات غير المتاحة.
نعم! انتقل إلى صفحة المقارنة، اختر حتى 4 نماذج وسترى مقارنة مفصلة لكل المقاييس: اختبارات وأسعار وسرعة وزمن استجابة.
Elo الأرينا تقييم تفضيل مبني على أصوات بشرية: يجيب نموذجان مجهولان على نفس الطلب، يصوّت الناس، وتحدّث الأصوات تقييم Elo مع فترات ثقة. إنه أكبر إشارة في ترتيبنا.
نعرض سعر رموز الإدخال والإخراج لكل مليون، مأخوذاً مباشرة من صفحة أسعار API الرسمية لكل مزوّد. تجمع فئة القيمة السعرين — كلما كان أقل كان أفضل.
بالتأكيد. نتتبع النماذج الاحتكارية ومفتوحة الأوزان: DeepSeek وAlibaba (Qwen) وMoonshot AI (Kimi) وZ.ai (GLM) وMiniMax وBaidu وغيرها. لنماذج الأوزان المفتوحة لوحة صدارة خاصة في /leaderboard/open.
يقيس TTFT الزمن من إرسال الطلب حتى استلام أول رمز من الإجابة. كلما كان أقل كان أفضل. إنه مقياس أساسي للتطبيقات التفاعلية حيث تهم الاستجابة.
بيانات لوحات الصدارة مأخوذة من اختبارات عامة. راجع تراخيص كل اختبار لشروط الاستخدام. ملخص قابل للقراءة آلياً متاح في /llms.txt.
عندما يحدّث مزوّد نموذجاً، نحدّث السجل الحالي أو ننشئ سجلاً جديداً حسب أهمية التغيير. النماذج المتوقفة تحتفظ بآخر نتيجة معروفة وتحصل على شارة "قديم".