Отчёт

Состояние LLM 2026: отчёт с пьедестала

Снимок ландшафта моделей на август 2026, целиком из данных нашего рейтинга: 58 отслеживаемых моделей, 25 бенчмарков, пять источников.

Вершина пьедестала

Claude Mythos Preview удерживает #1 с результатом 97.4, за ним Claude Fable 5 (93.4) и — единственная не-Anthropic модель на пьедестале — Kimi K3 (83.3), он же лучшая модель с открытыми весами. Anthropic занимает четыре из пяти верхних строк.

Разрыв открытых весов: 14 пунктов и сокращается

83.3 у Kimi K3 — примерно на 14 пунктов Podium ниже проприетарного фронта. На LiveCodeBench он обходит несколько закрытых моделей, стоящих в десять раз дороже. Однако после топ-3 открытых моделей оценки падают ниже 50 — открытое поле сейчас глубиной в одну лабораторию.

Цены: разброс 178×

Цены на вывод — от $0.28/M (DeepSeek V4 Flash) до $50/M (Claude Fable 5). Рынок разделился на три уровня: утилитарный (<$1/M), рабочий ($1–10/M) и фронтальный ($25–50/M). Рейтинг ценности показывает, что оптимум «интеллект на доллар» — на рабочем уровне.

Скорость: войны flash-моделей

Семейство Flash от Google занимает весь скоростной пьедестал — Gemini 3.5 Flash-Lite с 389 токенами/сек, а Muse Spark 1.1 от Meta (208 t/s за $4.25/M) — главная история года по скорости на доллар.

Что решило 2026

Агентные бенчмарки сменили чат-предпочтения на поле боя: SWE-Bench Verified (Fable 5 с 95%) и Terminal-Bench отделили лидеров, а Humanity's Last Exam остался потолком фронтира — никто не берёт его уверенно. Разбирайте любые матчи на новых страницах личных сравнений.

← Все статьи