LLM-Glossar
Die Kernbegriffe, die Ihnen beim Lesen der Rankings begegnen. Jeder Begriff mit kurzer Erklärung und Link zur passenden Seite.
Podium Score
Der 0–100-Gesamtscore von LLMPodium: 0.35·Arena-Elo + 0.30·Benchmark-Durchschnitt + 0.20·Intelligenz-Index + 0.15·LLM Stats, min-max-normalisiert mit Umverteilung fehlender Signale. — Live-Daten ansehen
Elo-Rating
Ein aus dem Schach übernommenes Bewertungssystem. In LLM-Arenen gewinnen Modelle Elo durch gewonnene Direktvergleiche nach Menschenurteil; die Elo-Differenz zweier Modelle sagt die Gewinnwahrscheinlichkeit voraus. — Live-Daten ansehen
Benchmark
Ein standardisierter Testsatz mit bewerteten Aufgaben (Mathe, Code, Wissenschaft), der eine bestimmte Modellfähigkeit unter vergleichbaren Bedingungen misst. — Live-Daten ansehen
Tokens
Die Subwort-Bausteine, die LLMs lesen und schreiben. Grob 1 Token ≈ 4 Zeichen englischer Text; Preise werden pro Million (M) Tokens angegeben.
Kontextfenster
Die maximale Textmenge (in Tokens), die ein Modell auf einmal berücksichtigen kann — Prompt plus Antwort. Frontier-Modelle 2026 liegen zwischen 128K und 1M Tokens. — Live-Daten ansehen
TTFT (Time to First Token)
Die Latenz bis zum ersten ausgegebenen Token. Bestimmt das empfundene Tempo im Chat; gemessen in Millisekunden. — Live-Daten ansehen
Ausgabedurchsatz (Tokens/s)
Wie viele Tokens pro Sekunde ein Modell nach dem ersten Token erzeugt. Bestimmt, wie schnell lange Antworten fließen. — Live-Daten ansehen
Mixture of Experts (MoE)
Eine Architektur, bei der pro Token nur eine Teilmenge der Parameter („Experten“) aktiviert wird — großes Wissen bei geringen Inferenzkosten, z. B. Qwen3.8 Max oder DeepSeek V4. — Live-Daten ansehen
Offene Gewichte
Modelle, deren trainierte Parameter veröffentlicht sind und die sich selbst hosten und feinjustieren lassen (Kimi K3, GLM-5.2, Llama 4). Im Gegensatz zu proprietären API-Modellen. — Live-Daten ansehen
Reasoning-Modell
Ein Modell, das trainiert ist, vor der Antwort zusätzliche „Denk“-Tokens zu verwenden — tauscht Latenz gegen Genauigkeit bei schweren Aufgaben (GPQA, HLE, Wettbewerbsmathematik). — Live-Daten ansehen
Halluzination
Eine selbstbewusste, aber unbelegte Aussage. Faktentreue-Benchmarks wie SimpleQA messen, wie oft Modelle sie vermeiden. — Live-Daten ansehen
SWE-Bench Verified
Das Lösen echter GitHub-Issues in echten Repositories, von Menschen verifiziert. Der Standard-Benchmark für agentisches Software-Engineering. — Live-Daten ansehen
GPQA Diamond
Wissenschaftsfragen auf Promotionsniveau, von Fachexperten geschrieben und „suchmaschinenfest“; ein zentraler Reasoning-Benchmark. — Live-Daten ansehen
Humanity's Last Exam
Ein von Experten verfasster Fragenkatalog an der Grenze des menschlichen Wissens; aktuelle Frontier-Modelle erreichen weiterhin 40–60%. — Live-Daten ansehen
MMLU-Pro
Der verschärfte Nachfolger des MMLU mit 14 Kategorien und schwereren Antwortoptionen für breites akademisches Wissen. — Live-Daten ansehen
Min-Max-Normalisierung
Die Umskalierung einer beliebigen Rohmetrik auf 0–100 über alle verfolgten Modelle, damit Scores aus verschiedenen Quellen mischbar sind. 80 heißt immer „80% des Wegs vom schlechtesten zum besten Modell“. — Live-Daten ansehen
Konfidenzintervall (±CI)
Die statistische Unsicherheit eines Arena-Elo. Überlappende Intervalle bedeuten, dass zwei Modelle praktisch gleichauf liegen. — Live-Daten ansehen
$/M Tokens
Preis pro Million Tokens, getrennt für Ein- und Ausgabe. Ausgabe-Tokens sind typischerweise 3–5× teurer als Eingabe-Tokens. — Live-Daten ansehen