LLM-Glossar

Die Kernbegriffe, die Ihnen beim Lesen der Rankings begegnen. Jeder Begriff mit kurzer Erklärung und Link zur passenden Seite.

Podium Score

Der 0–100-Gesamtscore von LLMPodium: 0.35·Arena-Elo + 0.30·Benchmark-Durchschnitt + 0.20·Intelligenz-Index + 0.15·LLM Stats, min-max-normalisiert mit Umverteilung fehlender Signale. — Live-Daten ansehen

Elo-Rating

Ein aus dem Schach übernommenes Bewertungssystem. In LLM-Arenen gewinnen Modelle Elo durch gewonnene Direktvergleiche nach Menschenurteil; die Elo-Differenz zweier Modelle sagt die Gewinnwahrscheinlichkeit voraus. — Live-Daten ansehen

Benchmark

Ein standardisierter Testsatz mit bewerteten Aufgaben (Mathe, Code, Wissenschaft), der eine bestimmte Modellfähigkeit unter vergleichbaren Bedingungen misst. — Live-Daten ansehen

Tokens

Die Subwort-Bausteine, die LLMs lesen und schreiben. Grob 1 Token ≈ 4 Zeichen englischer Text; Preise werden pro Million (M) Tokens angegeben.

Kontextfenster

Die maximale Textmenge (in Tokens), die ein Modell auf einmal berücksichtigen kann — Prompt plus Antwort. Frontier-Modelle 2026 liegen zwischen 128K und 1M Tokens. — Live-Daten ansehen

TTFT (Time to First Token)

Die Latenz bis zum ersten ausgegebenen Token. Bestimmt das empfundene Tempo im Chat; gemessen in Millisekunden. — Live-Daten ansehen

Ausgabedurchsatz (Tokens/s)

Wie viele Tokens pro Sekunde ein Modell nach dem ersten Token erzeugt. Bestimmt, wie schnell lange Antworten fließen. — Live-Daten ansehen

Mixture of Experts (MoE)

Eine Architektur, bei der pro Token nur eine Teilmenge der Parameter („Experten“) aktiviert wird — großes Wissen bei geringen Inferenzkosten, z. B. Qwen3.8 Max oder DeepSeek V4. — Live-Daten ansehen

Offene Gewichte

Modelle, deren trainierte Parameter veröffentlicht sind und die sich selbst hosten und feinjustieren lassen (Kimi K3, GLM-5.2, Llama 4). Im Gegensatz zu proprietären API-Modellen. — Live-Daten ansehen

Reasoning-Modell

Ein Modell, das trainiert ist, vor der Antwort zusätzliche „Denk“-Tokens zu verwenden — tauscht Latenz gegen Genauigkeit bei schweren Aufgaben (GPQA, HLE, Wettbewerbsmathematik). — Live-Daten ansehen

Halluzination

Eine selbstbewusste, aber unbelegte Aussage. Faktentreue-Benchmarks wie SimpleQA messen, wie oft Modelle sie vermeiden. — Live-Daten ansehen

SWE-Bench Verified

Das Lösen echter GitHub-Issues in echten Repositories, von Menschen verifiziert. Der Standard-Benchmark für agentisches Software-Engineering. — Live-Daten ansehen

GPQA Diamond

Wissenschaftsfragen auf Promotionsniveau, von Fachexperten geschrieben und „suchmaschinenfest“; ein zentraler Reasoning-Benchmark. — Live-Daten ansehen

Humanity's Last Exam

Ein von Experten verfasster Fragenkatalog an der Grenze des menschlichen Wissens; aktuelle Frontier-Modelle erreichen weiterhin 40–60%. — Live-Daten ansehen

MMLU-Pro

Der verschärfte Nachfolger des MMLU mit 14 Kategorien und schwereren Antwortoptionen für breites akademisches Wissen. — Live-Daten ansehen

Min-Max-Normalisierung

Die Umskalierung einer beliebigen Rohmetrik auf 0–100 über alle verfolgten Modelle, damit Scores aus verschiedenen Quellen mischbar sind. 80 heißt immer „80% des Wegs vom schlechtesten zum besten Modell“. — Live-Daten ansehen

Konfidenzintervall (±CI)

Die statistische Unsicherheit eines Arena-Elo. Überlappende Intervalle bedeuten, dass zwei Modelle praktisch gleichauf liegen. — Live-Daten ansehen

$/M Tokens

Preis pro Million Tokens, getrennt für Ein- und Ausgabe. Ausgabe-Tokens sind typischerweise 3–5× teurer als Eingabe-Tokens. — Live-Daten ansehen