अक्सर पूछे जाने वाले प्रश्न

LLMPodium की रैंकिंग, कार्यप्रणाली और डेटा के बारे में सब कुछ।

हर मॉडल को Podium Score (0–100) मिलता है: 35% एरीना Elo, 30% बेंचमार्क औसत, 20% Artificial Analysis का Intelligence Index और 15% LLM Stats — पाँच स्वतंत्र लीडरबोर्ड से सामान्यीकृत और संयोजित।

हम पाँचों स्रोतों को हर हफ्ते सिंक करते हैं। बड़े मॉडल रिलीज़ तुरंत अपडेट करते हैं। हर पृष्ठ पर अंतिम अपडेट तिथि दिखती है।

हम पाँच सार्वजनिक लीडरबोर्ड संकलित करते हैं: Arena.ai (एरीना Elo), Artificial Analysis (Intelligence Index और प्रदर्शन), LLM Stats, Vellum और LLMBase। कीमतें प्रदाता दस्तावेज़ से।

Podium Score चार सामान्यीकृत संकेतों का भारित औसत है: एरीना Elo (35%), बेंचमार्क औसत (30%), Intelligence Index (20%) और LLM Stats (15%)। अनुपस्थित संकेत अन्य स्रोतों में पुनर्वितरित होते हैं। विवरण कार्यप्रणाली पृष्ठ पर।

सभी मॉडल हर बेंचमार्क पर परीक्षित नहीं होते — कुछ को विशेष क्षमता चाहिए (जैसे MMMU के लिए विज़न) या नए मॉडलों पर अभी चले नहीं। उपलब्ध न होने पर हम “—” दिखाते हैं।

हाँ! तुलना पृष्ठ पर जाएँ, 4 तक मॉडल चुनें और सभी मेट्रिक की विस्तृत तुलना देखें: बेंचमार्क, कीमत, गति और विलंबता।

एरीना Elo मानव वोटों पर आधारित प्राथमिकता रेटिंग है: दो गुमनाम मॉडल एक ही प्रॉम्प्ट का उत्तर देते हैं, लोग वोट करते हैं, और वोट Elo रेटिंग को विश्वास अंतराल सहित अपडेट करते हैं। यह हमारी रैंकिंग का सबसे बड़ा संकेत है।

हम प्रति मिलियन इनपुट और आउटपुट टोकन की कीमत दिखाते हैं, सीधे हर प्रदाता के आधिकारिक API मूल्य पृष्ठ से। मूल्य श्रेणी दोनों कीमतें जोड़ती है — कम बेहतर।

बिल्कुल। हम प्रोपराइटरी और ओपन-वेट दोनों ट्रैक करते हैं: DeepSeek, Alibaba (Qwen), Moonshot AI (Kimi), Z.ai (GLM), MiniMax, Baidu और अन्य। ओपन-वेट मॉडलों का अपना लीडरबोर्ड /leaderboard/open पर है।

TTFT प्रॉम्प्ट भेजने से पहला उत्तर टोकन मिलने तक का समय मापता है। कम बेहतर। इंटरैक्टिव ऐप्स के लिए यह महत्वपूर्ण मेट्रिक है जहाँ तत्परता मायने रखती है।

लीडरबोर्ड डेटा सार्वजनिक बेंचमार्क से है। उपयोग शर्तों के लिए प्रत्येक बेंचमार्क का लाइसेंस देखें। मशीन-पठनीय सारांश /llms.txt पर उपलब्ध है।

जब कोई प्रदाता मॉडल अपडेट करता है, हम परिवर्तन के महत्व के आधार पर मौजूदा प्रविष्टि अपडेट करते हैं या नई बनाते हैं। बंद किए गए मॉडल अंतिम ज्ञात परिणाम रखते हैं और “पुराना” लेबल पाते हैं।