Ranking de LLMs · Atualizado em 5 de ago. de 2026
The Definitive
LLM Leaderboard.
Comparando 673 modelos de linguagem em 25 benchmarks, votos de arena, preços e velocidade — agregando cinco leaderboards independentes.
Agregado de 5 leaderboards independentes:
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
Arena.ai · Artificial Analysis · LLM Stats · Vellum Leaderboard · LLMBase
673+
Modelos
Flagship curated
25
Benchmarks
Rigorous evals
44
Provedores
Global AI labs
719
Modelos na arena
Human battle Elo
01 · Real-Time Rankings
Principais modelos
Top 10 Models by Overall Podium Score
Ver todos →| # | Modelo | Podium Score |
|---|---|---|
| 01 | Claude Mythos Preview Anthropic · Proprietary | 97.4 |
| 02 | Claude Fable 5 Anthropic · Proprietary | 93.4 |
| 03 | Kimi K3 Moonshot AI · Open Weights | 83.3 |
| 4 | Claude Opus 5 Anthropic · Proprietary | 81.4 |
| 5 | GPT-5.6 Sol OpenAI · Proprietary | 80.8 |
| 6 | Qwen3.8 Max Alibaba · Proprietary | 79.8 |
| 7 | Claude Opus 4.8 Anthropic · Proprietary | 76.0 |
| 8 | Claude Opus 4 6 Thinking Anthropic · Unknown | 75.0 |
| 9 | Claude Opus 4 7 Thinking Anthropic · Unknown | 75.0 |
| 10 | Claude Opus 5 Max Anthropic · Unknown | 75.0 |
02 · Evaluation Domains
Melhores por tarefa
Código
Engenharia de código: SWE-Bench, LiveCodeBench, SciCode, Terminal-Bench e HumanEval.
Líder: Claude Fable 5
Matemática
De olimpíadas de matemática a problemas de fronteira: AIME, MATH e FrontierMath.
Líder: Claude Mythos Preview
Raciocínio
Raciocínio profundo e ciência: GPQA Diamond, HLE e ARC-AGI-2.
Líder: Claude Mythos Preview
Agentes
Ferramentas autônomas e operação de computador: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
Líder: Kimi K3
Conhecimento
Fatos e resistência a alucinações: SimpleQA, MMLU-Pro e MMMLU.
Líder: Claude Mythos Preview
Multimodal
Compreensão de imagens e documentos: MMMU, CharXiv e ScreenSpot-Pro.
Líder: Claude Mythos Preview
03 · Research & Analysis
Últimos artigos
04 · FAQ
Perguntas frequentes
Cada modelo recebe um Podium Score (0–100) — uma mistura ponderada de quatro sinais: 35% Elo de arena de comparações humanas, 30% média de benchmarks, 20% Índice de Inteligência da Artificial Analysis e 15% pontuação do LLM Stats. Todos os sinais são normalizados para uma escala comum, então a pontuação é um meio-termo plausível entre cinco leaderboards independentes.
Claude Mythos Preview lidera com 97.4. Em seguida vêm Claude Fable 5 (93.4) e Kimi K3 (83.3). Os rankings mudam semanalmente conforme novos votos e resultados chegam.
Curamos 673 modelos flagship em 18 categorias (código, matemática, raciocínio, agentes, conhecimento, multimodal, contexto longo, velocidade, custo-benefício e pesos abertos), mais a tabela completa da arena com 719 modelos.
De cinco leaderboards públicos: Arena.ai, Artificial Analysis, LLM Stats, Vellum Leaderboard, LLMBase. Cada fonte é sincronizada semanalmente; a fórmula exata está na página de metodologia.