हम कैसे मूल्यांकन करते हैं
Podium Score पाँच स्वतंत्र लीडरबोर्ड को एक तुलनीय संख्या में जोड़ता है।
Podium Score सूत्र
Podium Score = 0.35·एरीना + 0.30·बेंचमार्क + 0.20·बुद्धिमत्ता + 0.15·LLM Stats
- Arena (35%) — उपयोगकर्ता जोड़ीदार वोटों से Elo रेटिंग (Arena.ai, 719 मॉडल, वोट-भारित, विश्वास अंतराल सहित)।
- Benchmarks (30%) — मॉडल के लिए हमारे द्वारा ट्रैक किए गए सभी सामान्यीकृत बेंचमार्क परिणामों का औसत (कुल 25 बेंचमार्क)।
- Intelligence Index (20%) — Artificial Analysis का समग्र बुद्धिमत्ता सूचकांक।
- LLM Stats (15%) — llm-stats.com द्वारा प्रकाशित समग्र स्कोर।
जब किसी स्रोत के पास किसी मॉडल के लिए मान नहीं होता, उसका भार अन्य स्रोतों में आनुपातिक रूप से पुनर्वितरित हो जाता है — एक लीडरबोर्ड में अनुपस्थिति के लिए मॉडल को कभी दंडित नहीं किया जाता।
सामान्यीकरण
प्रत्येक संकेत को सभी 673 ट्रैक किए गए मॉडलों पर min-max द्वारा 0–100 पैमाने पर सामान्य किया जाता है, इसलिए 80 का हमेशा अर्थ है "सबसे खराब और सबसे अच्छे देखे गए मॉडल के बीच 80% दूरी"। प्रतिशत बेंचमार्क जैसे हैं वैसे ही; Elo, सूचकांक और कीमतें अपनी सीमाओं पर सामान्य होती हैं।
श्रेणी स्कोर
समग्र रैंकिंग के अलावा हम 17 श्रेणी लीडरबोर्ड रखते हैं, प्रत्येक उस कार्य के लिए सबसे प्रासंगिक बेंचमार्क पर आधारित:
- Coding — SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, SciCode, Terminal-Bench, HumanEval.
- Math — AIME 2025, FrontierMath, MATH.
- Reasoning — GPQA Diamond, HLE, ARC-AGI-2.
- Agentic — OSWorld, Toolathlon, MCP Atlas, τ²-Bench Retail, Apex Agents.
- Knowledge — SimpleQA, MMLU-Pro, MMMLU.
- Multimodal — MMMU, MMMU-Pro, CharXiv-R, ScreenSpot-Pro.
- Coding Agents — SWE-Bench Verified, SWE-Bench Pro, Terminal-Bench Hard, τ²-Bench Retail.
- Scientific Reasoning — GPQA Diamond, Humanity’s Last Exam, SciCode.
- Multilingual — Multilingual MMLU.
- Writing — IFBench, Arena Elo.
- Chat & Assistants — Arena Elo, IFBench.
- Research — Humanity’s Last Exam, GPQA Diamond, MMLU-Pro.
- Tool Calling — Toolathlon, MCP Atlas, τ²-Bench Retail.
- Long Context — MRCR v2, Context window.
- Speed — Output tokens/s.
- Value — Blended price /1M, Cost per task.
- Open Weights — Podium Score.
डेटा स्रोत
सभी डेटा पाँच सार्वजनिक लीडरबोर्ड से संकलित होता है:
- Arena.ai — last synced 2026-08-04.
- Artificial Analysis — last synced 2026-08-03.
- LLM Stats — last synced 2026-08-02.
- Vellum Leaderboard — last synced 2026-07-24.
- LLMBase — last synced 2026-08-04.
अपडेट आवृत्ति
हम सभी स्रोतों को हर हफ्ते सिंक करते हैं; बड़े मॉडल रिलीज़ तुरंत अपडेट करते हैं। अंतिम पूर्ण अपडेट: 2026-08-05।
सीमाएँ
कोई भी बेंचमार्क पूर्ण नहीं है, और एरीना प्राथमिकता कार्य-योग्यता के बराबर नहीं है। विशिष्ट परिदृश्य निर्णयों के लिए श्रेणी लीडरबोर्ड और तुलना उपकरण का उपयोग करें। पूर्वावलोकन स्थिति वाले मॉडल चिह्नित हैं और नए वोट/परिणाम आने पर बदल सकते हैं।