Una fotografía del panorama de modelos a agosto de 2026, tomada completamente de los datos de nuestro ranking — 58 modelos rastreados, 25 benchmarks, cinco rankings fuente.
La cima del podio
Claude Mythos Preview mantiene el #1 con 97.4, seguido por Claude Fable 5 (93.4) y — el único modelo no Anthropic en el podio — Kimi K3 (83.3), que además es el mejor modelo de pesos abiertos que rastreamos. Anthropic ocupa cuatro de los cinco primeros puestos.
La brecha de pesos abiertos: 14 puntos y reduciéndose
Los 83.3 de Kimi K3 están unos 14 puntos Podium por debajo de la frontera propietaria. En LiveCodeBench supera a varios modelos cerrados que cuestan diez veces más. Tras los tres mejores modelos abiertos, sin embargo, las puntuaciones caen por debajo de 50 — el campo abierto tiene actualmente un solo laboratorio en la frontera.
Precios: una brecha de 178×
Los precios de salida van de $0.28/M (DeepSeek V4 Flash) a $50/M (Claude Fable 5). El mercado se segmentó en tres niveles: utilitario (<$1/M), de trabajo ($1–10/M) y frontera ($25–50/M). El ranking de valor muestra que el punto óptimo de inteligencia por dólar está en el nivel de trabajo.
Velocidad: la guerra de los flash
La familia Flash de Google domina el podio de velocidad — Gemini 3.5 Flash-Lite a 389 tokens/segundo — mientras Muse Spark 1.1 de Meta (208 t/s a $4.25/M) es la mejor historia de velocidad por dólar del año.
Qué definió 2026
Los benchmarks agénticos reemplazaron la preferencia de chat como campo de batalla: SWE-Bench Verified (Fable 5 con 95%) y Terminal-Bench separaron a los líderes, mientras Humanity's Last Exam sigue siendo el techo de la frontera — nadie lo resuelve con comodidad. Explora cualquier enfrentamiento en las nuevas páginas de comparación directa.