LLM शब्दावली

रैंकिंग पढ़ते समय मिलने वाली मुख्य अवधारणाएँ। हर शब्द के साथ संक्षिप्त व्याख्या और संबंधित पेज का लिंक है।

Podium Score

LLMPodium का 0–100 समग्र स्कोर: 0.35·एरीना Elo + 0.30·बेंचमार्क औसत + 0.20·इंटेलिजेंस इंडेक्स + 0.15·LLM Stats, min-max सामान्यीकरण और अनुपस्थित संकेतों की पुनर्भारित के साथ। — लाइव डेटा देखें

Elo रेटिंग

शतरंज से ली गई रेटिंग प्रणाली। LLM एरीना में मॉडल मानव-प्राथमिकता के आमने-सामने मुकाबले जीतकर Elo कमाते हैं; दो Elo का अंतर जीत की संभावना बताता है। — लाइव डेटा देखें

बेंचमार्क

स्कोर किए गए कार्यों (गणित, कोडिंग, विज्ञान) वाला मानकीकृत परीक्षण समूह, जो तुलनीय परिस्थितियों में मॉडल की किसी विशेष क्षमता को मापता है। — लाइव डेटा देखें

टोकन

वे उप-शब्द खंड जिन्हें LLM पढ़ते और लिखते हैं। लगभग 1 टोकन ≈ अंग्रेज़ी के 4 अक्षर (हिंदी में ~1 शब्द); कीमतें प्रति मिलियन (M) टोकन बताई जाती हैं।

कॉन्टेक्स्ट विंडो

अधिकतम टेक्स्ट (टोकन में) जो मॉडल एक बार में देख सकता है — प्रॉम्प्ट + उत्तर। 2026 के फ्रंटियर मॉडल 128K से 1M टोकन तक। — लाइव डेटा देखें

TTFT (पहले टोकन तक का समय)

पहला आउटपुट टोकन आने तक की देरी। चैट की अनुभवी तत्परता यही तय करती है; मिलीसेकंड में मापी जाती है। — लाइव डेटा देखें

आउटपुट थ्रूपुट (टोकन/सेकंड)

पहले टोकन के बाद मॉडल प्रति सेकंड कितने टोकन बनाता है। लंबे उत्तरों की गति यही तय करती है। — लाइव डेटा देखें

Mixture of Experts (MoE)

एक आर्किटेक्चर जिसमें प्रति टोकन पैरामीटर का केवल एक उपसमूह («विशेषज्ञ») सक्रिय होता है — कम इन्फ़रेंस लागत में बड़ा ज्ञान — जैसे Qwen3.8 Max या DeepSeek V4। — लाइव डेटा देखें

ओपन वेट

जिन मॉडलों के प्रशिक्षित पैरामीटर सार्वजनिक हैं, जिन्हें स्वयं होस्ट और फाइन-ट्यून किया जा सकता है (Kimi K3, GLM-5.2, Llama 4)। केवल-API वाले मालिकाना मॉडलों के विपरीत। — लाइव डेटा देखें

रीज़निंग मॉडल

उत्तर से पहले अतिरिक्त «सोच» टोकन खर्च करने के लिए प्रशिक्षित मॉडल — कठिन समस्याओं (GPQA, HLE, प्रतियोगिता गणित) पर देरी के बदले सटीकता। — लाइव डेटा देखें

हैलुसिनेशन

आत्मविश्वास से भरा लेकिन आधारहीन कथन। SimpleQA जैसे तथ्य-बेंचमार्क मापते हैं कि मॉडल इन्हें कितनी बार टालते हैं। — लाइव डेटा देखें

SWE-Bench Verified

वास्तविक रिपॉजिटरी में वास्तविक GitHub issues का समाधान, मानव-सत्यापित। एजेंटिक सॉफ्टवेयर इंजीनियरिंग का मानक बेंचमार्क। — लाइव डेटा देखें

GPQA Diamond

विशेषज्ञों द्वारा लिखे स्नातकोत्तर-स्तरीय «सर्च-प्रूफ» विज्ञान प्रश्न; मुख्य रीज़निंग बेंचमार्क। — लाइव डेटा देखें

Humanity's Last Exam

मानव ज्ञान की सीमा पर रखे गए विशेषज्ञ-रचित प्रश्नों का समूह; मौजूदा फ्रंटियर मॉडल अभी भी 40–60% अंक लाते हैं। — लाइव डेटा देखें

MMLU-Pro

MMLU का कठोर उत्तराधिकारी: 14 श्रेणियाँ और कठिन विकल्प, व्यापक शैक्षणिक ज्ञान मापने के लिए। — लाइव डेटा देखें

Min-max सामान्यीकरण

किसी भी कच्चे मेट्रिक को सभी ट्रैक किए गए मॉडलों पर 0–100 में पुनः स्केल करना, ताकि अलग-अलग स्रोतों के स्कोर मिलाए जा सकें। 80 का अर्थ हमेशा «सबसे खराब से सबसे अच्छे तक 80% दूरी»। — लाइव डेटा देखें

विश्वास अंतराल (±CI)

एरीना Elo की सांख्यिकीय अनिश्चितता। अंतराल ओवरलैप होने का मतलब है दो मॉडल व्यावहारिक रूप से बराबर हैं। — लाइव डेटा देखें

$/M टोकन

प्रति मिलियन टोकन कीमत, इनपुट और आउटपुट के लिए अलग-अलग। आउटपुट टोकन आमतौर पर इनपुट से 3–5 गुना महँगे होते हैं। — लाइव डेटा देखें