Um retrato do cenário de modelos em agosto de 2026, extraído inteiramente dos dados do nosso ranking — 58 modelos acompanhados, 25 benchmarks, cinco rankings de origem.
O topo do pódio
O Claude Mythos Preview mantém o #1 com 97.4, seguido pelo Claude Fable 5 (93.4) e — o único modelo não Anthropic no pódio — Kimi K3 (83.3), que também é o melhor modelo de pesos abertos que acompanhamos. A Anthropic ocupa quatro das cinco primeiras posições.
A lacuna de pesos abertos: 14 pontos e diminuindo
Os 83.3 do Kimi K3 estão cerca de 14 pontos Podium abaixo da fronteira proprietária. No LiveCodeBench ele supera vários modelos fechados que custam dez vezes mais. Depois dos três melhores modelos abertos, porém, as pontuações caem abaixo de 50 — o campo aberto tem atualmente um único laboratório na fronteira.
Preços: uma diferença de 178×
Os preços de saída variam de $0.28/M (DeepSeek V4 Flash) a $50/M (Claude Fable 5). O mercado se segmentou em três níveis: utilitário (<$1/M), de trabalho ($1–10/M) e fronteira ($25–50/M). O ranking de valor mostra que o ponto ideal de inteligência por dólar está no nível de trabalho.
Velocidade: a guerra dos flash
A família Flash do Google domina o pódio de velocidade — Gemini 3.5 Flash-Lite a 389 tokens/segundo — enquanto o Muse Spark 1.1 da Meta (208 t/s a $4.25/M) é a melhor história de velocidade por dólar do ano.
O que definiu 2026
Os benchmarks agentados substituíram a preferência de chat como campo de batalha: SWE-Bench Verified (Fable 5 com 95%) e Terminal-Bench separaram os líderes, enquanto o Humanity's Last Exam continua sendo o teto da fronteira — ninguém o resolve com conforto. Explore qualquer confronto nas novas páginas de confronto direto.