Glossario LLM

I concetti essenziali che incontrerai leggendo le classifiche. Ogni termine con una breve spiegazione e un link alla pagina correlata.

Podium Score

Il punteggio composito 0–100 di LLMPodium: 0.35·Elo dell'arena + 0.30·media dei benchmark + 0.20·Indice di intelligenza + 0.15·LLM Stats, normalizzato min-max con riponderazione dei segnali mancanti. — vedi i dati live

Rating Elo

Un sistema di punteggio preso dagli scacchi. Nelle arene LLM i modelli guadagnano Elo vincendo scontri diretti giudicati dagli umani; la differenza tra due Elo predice la probabilità di vittoria. — vedi i dati live

Benchmark

Un set di test standardizzato con compiti valutati (matematica, codice, scienza) per misurare una capacità specifica del modello in condizioni comparabili. — vedi i dati live

Token

I frammenti di sub-parola che gli LLM leggono e scrivono. Circa 1 token ≈ 4 caratteri di testo inglese; i prezzi sono indicati per milione (M) di token.

Finestra di contesto

La quantità massima di testo (in token) che un modello può considerare alla volta — prompt più risposta. I modelli frontier del 2026 vanno da 128K a 1M di token. — vedi i dati live

TTFT (tempo al primo token)

La latenza prima dell'arrivo del primo token di output. Domina la reattività percepita in chat; misurata in millisecondi. — vedi i dati live

Throughput di output (token/s)

Quanti token al secondo genera un modello dopo il primo token. Determina la velocità delle risposte lunghe. — vedi i dati live

Mixture of Experts (MoE)

Un'architettura in cui solo un sottoinsieme dei parametri («esperti») si attiva per token: grande conoscenza a basso costo di inferenza — es. Qwen3.8 Max o DeepSeek V4. — vedi i dati live

Pesi aperti

Modelli i cui parametri addestrati sono pubblici, consentendo self-hosting e fine-tuning (Kimi K3, GLM-5.2, Llama 4). In contrasto con i modelli proprietari solo API. — vedi i dati live

Modello di ragionamento

Un modello addestrato a usare token extra di «pensiero» prima di rispondere: scambia latenza con precisione sui problemi difficili (GPQA, HLE, matematica da competizione). — vedi i dati live

Allucinazione

Un'affermazione sicura ma infondata. I benchmark di fattualità come SimpleQA misurano quanto spesso i modelli le evitano. — vedi i dati live

SWE-Bench Verified

Risolvere issue reali di GitHub in repository reali, verificato da umani. Il benchmark standard dell'ingegneria del software agentica. — vedi i dati live

GPQA Diamond

Domande scientifiche di livello dottorale scritte da esperti e «a prova di ricerca»; un benchmark centrale di ragionamento. — vedi i dati live

Humanity's Last Exam

Un set di domande create da esperti al confine della conoscenza umana; i modelli frontier attuali segnano ancora 40–60%. — vedi i dati live

MMLU-Pro

Il successore rafforzato di MMLU: 14 categorie e opzioni più difficili per misurare un'ampia conoscenza accademica. — vedi i dati live

Normalizzazione min-max

Riscalare qualsiasi metrica grezza a 0–100 sull'intero insieme di modelli tracciati, così da poter mescolare punteggi di fonti diverse. 80 significa sempre «80% del percorso dal peggiore al migliore». — vedi i dati live

Intervallo di confidenza (±CI)

L'incertezza statistica di un Elo dell'arena. Intervalli sovrapposti significano che due modelli sono di fatto alla pari. — vedi i dati live

$/M token

Prezzo per milione di token, indicato separatamente per input e output. I token di output sono in genere 3–5 volte più costosi di quelli di input. — vedi i dati live