LLM शब्दावली
रैंकिंग पढ़ते समय मिलने वाली मुख्य अवधारणाएँ। हर शब्द के साथ संक्षिप्त व्याख्या और संबंधित पेज का लिंक है।
Podium Score
LLMPodium का 0–100 समग्र स्कोर: 0.35·एरीना Elo + 0.30·बेंचमार्क औसत + 0.20·इंटेलिजेंस इंडेक्स + 0.15·LLM Stats, min-max सामान्यीकरण और अनुपस्थित संकेतों की पुनर्भारित के साथ। — लाइव डेटा देखें
Elo रेटिंग
शतरंज से ली गई रेटिंग प्रणाली। LLM एरीना में मॉडल मानव-प्राथमिकता के आमने-सामने मुकाबले जीतकर Elo कमाते हैं; दो Elo का अंतर जीत की संभावना बताता है। — लाइव डेटा देखें
बेंचमार्क
स्कोर किए गए कार्यों (गणित, कोडिंग, विज्ञान) वाला मानकीकृत परीक्षण समूह, जो तुलनीय परिस्थितियों में मॉडल की किसी विशेष क्षमता को मापता है। — लाइव डेटा देखें
टोकन
वे उप-शब्द खंड जिन्हें LLM पढ़ते और लिखते हैं। लगभग 1 टोकन ≈ अंग्रेज़ी के 4 अक्षर (हिंदी में ~1 शब्द); कीमतें प्रति मिलियन (M) टोकन बताई जाती हैं।
कॉन्टेक्स्ट विंडो
अधिकतम टेक्स्ट (टोकन में) जो मॉडल एक बार में देख सकता है — प्रॉम्प्ट + उत्तर। 2026 के फ्रंटियर मॉडल 128K से 1M टोकन तक। — लाइव डेटा देखें
TTFT (पहले टोकन तक का समय)
पहला आउटपुट टोकन आने तक की देरी। चैट की अनुभवी तत्परता यही तय करती है; मिलीसेकंड में मापी जाती है। — लाइव डेटा देखें
आउटपुट थ्रूपुट (टोकन/सेकंड)
पहले टोकन के बाद मॉडल प्रति सेकंड कितने टोकन बनाता है। लंबे उत्तरों की गति यही तय करती है। — लाइव डेटा देखें
Mixture of Experts (MoE)
एक आर्किटेक्चर जिसमें प्रति टोकन पैरामीटर का केवल एक उपसमूह («विशेषज्ञ») सक्रिय होता है — कम इन्फ़रेंस लागत में बड़ा ज्ञान — जैसे Qwen3.8 Max या DeepSeek V4। — लाइव डेटा देखें
ओपन वेट
जिन मॉडलों के प्रशिक्षित पैरामीटर सार्वजनिक हैं, जिन्हें स्वयं होस्ट और फाइन-ट्यून किया जा सकता है (Kimi K3, GLM-5.2, Llama 4)। केवल-API वाले मालिकाना मॉडलों के विपरीत। — लाइव डेटा देखें
रीज़निंग मॉडल
उत्तर से पहले अतिरिक्त «सोच» टोकन खर्च करने के लिए प्रशिक्षित मॉडल — कठिन समस्याओं (GPQA, HLE, प्रतियोगिता गणित) पर देरी के बदले सटीकता। — लाइव डेटा देखें
हैलुसिनेशन
आत्मविश्वास से भरा लेकिन आधारहीन कथन। SimpleQA जैसे तथ्य-बेंचमार्क मापते हैं कि मॉडल इन्हें कितनी बार टालते हैं। — लाइव डेटा देखें
SWE-Bench Verified
वास्तविक रिपॉजिटरी में वास्तविक GitHub issues का समाधान, मानव-सत्यापित। एजेंटिक सॉफ्टवेयर इंजीनियरिंग का मानक बेंचमार्क। — लाइव डेटा देखें
GPQA Diamond
विशेषज्ञों द्वारा लिखे स्नातकोत्तर-स्तरीय «सर्च-प्रूफ» विज्ञान प्रश्न; मुख्य रीज़निंग बेंचमार्क। — लाइव डेटा देखें
Humanity's Last Exam
मानव ज्ञान की सीमा पर रखे गए विशेषज्ञ-रचित प्रश्नों का समूह; मौजूदा फ्रंटियर मॉडल अभी भी 40–60% अंक लाते हैं। — लाइव डेटा देखें
MMLU-Pro
MMLU का कठोर उत्तराधिकारी: 14 श्रेणियाँ और कठिन विकल्प, व्यापक शैक्षणिक ज्ञान मापने के लिए। — लाइव डेटा देखें
Min-max सामान्यीकरण
किसी भी कच्चे मेट्रिक को सभी ट्रैक किए गए मॉडलों पर 0–100 में पुनः स्केल करना, ताकि अलग-अलग स्रोतों के स्कोर मिलाए जा सकें। 80 का अर्थ हमेशा «सबसे खराब से सबसे अच्छे तक 80% दूरी»। — लाइव डेटा देखें
विश्वास अंतराल (±CI)
एरीना Elo की सांख्यिकीय अनिश्चितता। अंतराल ओवरलैप होने का मतलब है दो मॉडल व्यावहारिक रूप से बराबर हैं। — लाइव डेटा देखें
$/M टोकन
प्रति मिलियन टोकन कीमत, इनपुट और आउटपुट के लिए अलग-अलग। आउटपुट टोकन आमतौर पर इनपुट से 3–5 गुना महँगे होते हैं। — लाइव डेटा देखें