Glossário de LLM

Os conceitos essenciais que você encontrará ao ler os rankings. Cada termo com uma explicação breve e um link para a página relacionada.

Podium Score

O score composto 0–100 do LLMPodium: 0.35·Elo da arena + 0.30·média de benchmarks + 0.20·Índice de Inteligência + 0.15·LLM Stats, normalizado min-max com reponderação de sinais ausentes. — ver dados ao vivo

Rating Elo

Um sistema de pontuação herdado do xadrez. Nas arenas de LLM, os modelos ganham Elo ao vencer duelos de preferência humana; a diferença entre dois Elo prevê a probabilidade de vitória. — ver dados ao vivo

Benchmark

Um conjunto de testes padronizado com tarefas pontuadas (matemática, código, ciência) para medir uma capacidade específica do modelo em condições comparáveis. — ver dados ao vivo

Tokens

Os fragmentos de subpalavras que os LLMs leem e escrevem. Aproximadamente 1 token ≈ 4 caracteres de texto em inglês; os preços são cotados por milhão (M) de tokens.

Janela de contexto

A quantidade máxima de texto (em tokens) que um modelo consegue considerar de uma vez — prompt mais resposta. Os modelos de fronteira de 2026 vão de 128K a 1M de tokens. — ver dados ao vivo

TTFT (tempo até o primeiro token)

A latência até a chegada do primeiro token de saída. Domina a capacidade de resposta percebida no chat; medida em milissegundos. — ver dados ao vivo

Vazão de saída (tokens/s)

Quantos tokens por segundo um modelo gera após o primeiro token. Determina a velocidade das respostas longas. — ver dados ao vivo

Mixture of Experts (MoE)

Uma arquitetura em que apenas um subconjunto dos parâmetros («especialistas») é ativado por token: muito conhecimento com baixo custo de inferência — ex.: Qwen3.8 Max ou DeepSeek V4. — ver dados ao vivo

Pesos abertos

Modelos cujos parâmetros treinados são publicados, permitindo auto-hospedagem e fine-tuning (Kimi K3, GLM-5.2, Llama 4). Em contraste com modelos proprietários somente por API. — ver dados ao vivo

Modelo de raciocínio

Um modelo treinado para gastar tokens extras de «pensamento» antes de responder: troca latência por precisão em problemas difíceis (GPQA, HLE, matemática de competição). — ver dados ao vivo

Alucinação

Uma afirmação confiante, mas sem fundamento. Benchmarks de factualidade como o SimpleQA medem com que frequência os modelos as evitam. — ver dados ao vivo

SWE-Bench Verified

Resolver issues reais do GitHub em repositórios reais, verificado por humanos. O benchmark padrão da engenharia de software agentada. — ver dados ao vivo

GPQA Diamond

Perguntas científicas de nível de pós-graduação escritas por especialistas e «à prova de busca»; um benchmark central de raciocínio. — ver dados ao vivo

Humanity's Last Exam

Um conjunto de perguntas criadas por especialistas na fronteira do conhecimento humano; os modelos de fronteira atuais ainda pontuam 40–60%. — ver dados ao vivo

MMLU-Pro

O sucessor endurecido do MMLU: 14 categorias e opções mais difíceis para medir conhecimento acadêmico amplo. — ver dados ao vivo

Normalização min-max

Reescalonar qualquer métrica bruta para 0–100 em todo o conjunto de modelos acompanhados, para que scores de fontes diferentes possam ser misturados. 80 significa sempre «80% do caminho do pior ao melhor». — ver dados ao vivo

Intervalo de confiança (±CI)

A incerteza estatística de um Elo da arena. Intervalos sobrepostos significam que dois modelos estão efetivamente empatados. — ver dados ao vivo

$/M tokens

Preço por milhão de tokens, cotado separadamente para entrada e saída. Tokens de saída costumam ser 3–5× mais caros que os de entrada. — ver dados ao vivo