Глоссарий LLM

Основные понятия, которые встречаются при чтении рейтингов. Каждый термин — с кратким объяснением и ссылкой на связанную страницу.

Podium Score

Композитный рейтинг LLMPodium от 0 до 100: 0.35·Arena Elo + 0.30·среднее бенчмарков + 0.20·Индекс интеллекта + 0.15·LLM Stats, с min-max нормализацией и перераспределением веса отсутствующих сигналов. — смотреть данные

Рейтинг Elo

Система рейтинга из шахмат. В LLM-аренах модели получают Elo, выигрывая очные сравнения у людей; разница двух Elo предсказывает вероятность победы. — смотреть данные

Бенчмарк

Стандартизированный набор заданий с оценкой (математика, код, наука) для измерения конкретной способности модели в сопоставимых условиях. — смотреть данные

Токены

Субсловесные фрагменты, которые LLM читает и пишет. Примерно 1 токен ≈ 4 символа английского текста (≈0.5–1 слово русского); цены указываются за миллион (M) токенов.

Контекстное окно

Максимальный объём текста (в токенах), который модель может учесть за раз — промпт плюс ответ. У флагманов 2026 года от 128K до 1M токенов. — смотреть данные

TTFT (время до первого токена)

Задержка до прихода первого токена ответа. Определяет ощущаемую отзывчивость в чате; измеряется в миллисекундах. — смотреть данные

Скорость вывода (токенов/с)

Сколько токенов в секунду генерирует модель после первого токена. Определяет скорость потока длинных ответов. — смотреть данные

Mixture of Experts (MoE)

Архитектура, где на каждый токен активируется лишь подмножество параметров («экспертов»): большие знания при малых затратах на инференс — например Qwen3.8 Max или DeepSeek V4. — смотреть данные

Открытые веса

Модели, чьи обученные параметры опубликованы: их можно хостить у себя и дообучать (Kimi K3, GLM-5.2, Llama 4). Противоположность проприетарных API-моделей. — смотреть данные

Рассуждающая модель

Модель, обученная тратить дополнительные токены «размышлений» перед ответом: обменивает задержку на точность в сложных задачах (GPQA, HLE, олимпиадная математика). — смотреть данные

Галлюцинация

Уверенное, но необоснованное утверждение. Бенчмарки фактологичности вроде SimpleQA измеряют, как часто модель их избегает. — смотреть данные

SWE-Bench Verified

Решение реальных GitHub issues в реальных репозиториях с человеческой верификацией. Стандартный бенчмарк агентной разработки ПО. — смотреть данные

GPQA Diamond

Научные вопросы уровня аспирантуры, написанные экспертами и устойчивые к поиску в интернете; ключевой бенчмарк рассуждений. — смотреть данные

Humanity's Last Exam

Составленный экспертами набор вопросов на границе человеческих знаний; флагманские модели пока набирают 40–60%. — смотреть данные

MMLU-Pro

Усиленный преемник MMLU: 14 категорий и более сложные варианты ответов для проверки широких академических знаний. — смотреть данные

Min-max нормализация

Приведение любой сырой метрики к шкале 0–100 по всему набору отслеживаемых моделей, чтобы оценки из разных источников можно было смешивать. 80 всегда означает «80% пути от худшей к лучшей». — смотреть данные

Доверительный интервал (±CI)

Статистическая неопределённость Elo арены. Пересекающиеся интервалы означают, что модели практически равны. — смотреть данные

$/M токенов

Цена за миллион токенов, отдельно для входа и выхода. Выходные токены обычно в 3–5 раз дороже входных. — смотреть данные