ہم کیسے جانچتے ہیں
Podium Score پانچ آزاد لیڈر بورڈز کو ایک قابلِ موازنہ عدد میں جوڑتا ہے۔
Podium Score فارمولا
Podium Score = 0.35·ارینا + 0.30·بینچ مارک + 0.20·ذہانت + 0.15·LLM Stats
- Arena (35%) — صارفین کے جوڑے دار ووٹوں سے Elo ریٹنگ (Arena.ai، 719 ماڈلز، ووٹ سے وزنی، اعتماد کے وقفوں کے ساتھ)۔
- Benchmarks (30%) — ماڈل کے لیے ہمارے ٹریک کردہ تمام معمول کیے گئے بینچ مارک نتائج کی اوسط (کل 25 بینچ مارکس)۔
- Intelligence Index (20%) — Artificial Analysis کا مرکب ذہانت انڈیکس۔
- LLM Stats (15%) — llm-stats.com کا شائع شدہ مرکب اسکور۔
جب کسی ذریعے کے پاس کسی ماڈل کی قدر نہ ہو، اس کا وزن دیگر ذرائع میں تناسب سے دوبارہ تقسیم ہو جاتا ہے — ایک لیڈر بورڈ میں غیر موجودگی پر ماڈل کو کبھی سزا نہیں دی جاتی۔
معمول کاری
ہر اشارے کو تمام 673 ٹریک شدہ ماڈلز پر min-max سے 0–100 پیمانے پر معمول کیا جاتا ہے، لہذا 80 کا مطلب ہمیشہ "بدترین اور بہترین مشاہدہ شدہ ماڈل کے درمیان 80% فاصلہ" ہے۔ فیصد بینچ مارک جیسے ہیں ویسے ہی؛ Elo، انڈیکس اور قیمتیں اپنی حدود پر معمول ہوتی ہیں۔
زمرہ اسکور
مجموعی درجہ بندی کے علاوہ ہم 17 زمرہ لیڈر بورڈز رکھتے ہیں، ہر ایک اس کام کے لیے سب سے متعلقہ بینچ مارکس پر مبنی:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
ڈیٹا ذرائع
تمام ڈیٹا پانچ عوامی لیڈر بورڈز سے مرتب کیا جاتا ہے:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
اپ ڈیٹ کی تعدد
ہم تمام ذرائع کو ہر ہفتے ہم آہنگ کرتے ہیں؛ بڑے ماڈل اجراء فوری اپ ڈیٹ کرتے ہیں۔ آخری مکمل اپ ڈیٹ: 2026-08-05۔
حدود
کوئی بینچ مارک کامل نہیں، اور ارینا کی ترجیحات کام کی موزونیت کے برابر نہیں۔ مخصوص منظر نامے کے فیصلوں کے لیے زمرہ لیڈر بورڈز اور موازنہ ٹول استعمال کریں۔ پیش نظارہ حیثیت والے ماڈلز نشان زد ہیں اور نئے ووٹس/نتائج پر بدل سکتے ہیں۔