Glossário de LLM
Os conceitos essenciais que você encontrará ao ler os rankings. Cada termo com uma explicação breve e um link para a página relacionada.
Podium Score
O score composto 0–100 do LLMPodium: 0.35·Elo da arena + 0.30·média de benchmarks + 0.20·Índice de Inteligência + 0.15·LLM Stats, normalizado min-max com reponderação de sinais ausentes. — ver dados ao vivo
Rating Elo
Um sistema de pontuação herdado do xadrez. Nas arenas de LLM, os modelos ganham Elo ao vencer duelos de preferência humana; a diferença entre dois Elo prevê a probabilidade de vitória. — ver dados ao vivo
Benchmark
Um conjunto de testes padronizado com tarefas pontuadas (matemática, código, ciência) para medir uma capacidade específica do modelo em condições comparáveis. — ver dados ao vivo
Tokens
Os fragmentos de subpalavras que os LLMs leem e escrevem. Aproximadamente 1 token ≈ 4 caracteres de texto em inglês; os preços são cotados por milhão (M) de tokens.
Janela de contexto
A quantidade máxima de texto (em tokens) que um modelo consegue considerar de uma vez — prompt mais resposta. Os modelos de fronteira de 2026 vão de 128K a 1M de tokens. — ver dados ao vivo
TTFT (tempo até o primeiro token)
A latência até a chegada do primeiro token de saída. Domina a capacidade de resposta percebida no chat; medida em milissegundos. — ver dados ao vivo
Vazão de saída (tokens/s)
Quantos tokens por segundo um modelo gera após o primeiro token. Determina a velocidade das respostas longas. — ver dados ao vivo
Mixture of Experts (MoE)
Uma arquitetura em que apenas um subconjunto dos parâmetros («especialistas») é ativado por token: muito conhecimento com baixo custo de inferência — ex.: Qwen3.8 Max ou DeepSeek V4. — ver dados ao vivo
Pesos abertos
Modelos cujos parâmetros treinados são publicados, permitindo auto-hospedagem e fine-tuning (Kimi K3, GLM-5.2, Llama 4). Em contraste com modelos proprietários somente por API. — ver dados ao vivo
Modelo de raciocínio
Um modelo treinado para gastar tokens extras de «pensamento» antes de responder: troca latência por precisão em problemas difíceis (GPQA, HLE, matemática de competição). — ver dados ao vivo
Alucinação
Uma afirmação confiante, mas sem fundamento. Benchmarks de factualidade como o SimpleQA medem com que frequência os modelos as evitam. — ver dados ao vivo
SWE-Bench Verified
Resolver issues reais do GitHub em repositórios reais, verificado por humanos. O benchmark padrão da engenharia de software agentada. — ver dados ao vivo
GPQA Diamond
Perguntas científicas de nível de pós-graduação escritas por especialistas e «à prova de busca»; um benchmark central de raciocínio. — ver dados ao vivo
Humanity's Last Exam
Um conjunto de perguntas criadas por especialistas na fronteira do conhecimento humano; os modelos de fronteira atuais ainda pontuam 40–60%. — ver dados ao vivo
MMLU-Pro
O sucessor endurecido do MMLU: 14 categorias e opções mais difíceis para medir conhecimento acadêmico amplo. — ver dados ao vivo
Normalização min-max
Reescalonar qualquer métrica bruta para 0–100 em todo o conjunto de modelos acompanhados, para que scores de fontes diferentes possam ser misturados. 80 significa sempre «80% do caminho do pior ao melhor». — ver dados ao vivo
Intervalo de confiança (±CI)
A incerteza estatística de um Elo da arena. Intervalos sobrepostos significam que dois modelos estão efetivamente empatados. — ver dados ao vivo
$/M tokens
Preço por milhão de tokens, cotado separadamente para entrada e saída. Tokens de saída costumam ser 3–5× mais caros que os de entrada. — ver dados ao vivo