Glosario LLM
Los conceptos esenciales que encontrarás al leer los rankings. Cada término incluye una explicación breve y un enlace a la página relacionada.
Podium Score
La puntuación compuesta 0–100 de LLMPodium: 0.35·Elo de arena + 0.30·promedio de benchmarks + 0.20·Índice de Inteligencia + 0.15·LLM Stats, normalizada min-max con reponderación de señales ausentes. — ver datos en vivo
Rating Elo
Un sistema de puntuación tomado del ajedrez. En las arenas LLM, los modelos ganan Elo al vencer en duelos de preferencia humana; la diferencia entre dos Elo predice la probabilidad de victoria. — ver datos en vivo
Benchmark
Un conjunto de pruebas estandarizado con tareas puntuadas (matemáticas, código, ciencia) para medir una capacidad concreta del modelo en condiciones comparables. — ver datos en vivo
Tokens
Los fragmentos de subpalabras que los LLM leen y escriben. Aproximadamente 1 token ≈ 4 caracteres de texto en inglés; los precios se indican por millón (M) de tokens.
Ventana de contexto
La cantidad máxima de texto (en tokens) que un modelo puede considerar a la vez — prompt más respuesta. Los modelos frontera de 2026 van de 128K a 1M de tokens. — ver datos en vivo
TTFT (tiempo hasta el primer token)
La latencia hasta que llega el primer token de salida. Domina la capacidad de respuesta percibida en el chat; se mide en milisegundos. — ver datos en vivo
Rendimiento de salida (tokens/s)
Cuántos tokens por segundo genera un modelo tras el primer token. Determina la velocidad de las respuestas largas. — ver datos en vivo
Mixture of Experts (MoE)
Una arquitectura donde solo se activa un subconjunto de parámetros («expertos») por token: gran conocimiento con bajo coste de inferencia — p. ej. Qwen3.8 Max o DeepSeek V4. — ver datos en vivo
Pesos abiertos
Modelos cuyos parámetros entrenados se publican, permitiendo auto-alojamiento y fine-tuning (Kimi K3, GLM-5.2, Llama 4). En contraste con los modelos propietarios solo por API. — ver datos en vivo
Modelo de razonamiento
Un modelo entrenado para gastar tokens extra de «pensamiento» antes de responder: cambia latencia por precisión en problemas difíciles (GPQA, HLE, matemáticas de competición). — ver datos en vivo
Alucinación
Una afirmación segura pero sin fundamento. Benchmarks de factualidad como SimpleQA miden con qué frecuencia los modelos las evitan. — ver datos en vivo
SWE-Bench Verified
Resolver issues reales de GitHub en repositorios reales, verificado por humanos. El benchmark estándar de la ingeniería de software agéntica. — ver datos en vivo
GPQA Diamond
Preguntas científicas de nivel de posgrado escritas por expertos y «a prueba de buscadores»; un benchmark central de razonamiento. — ver datos en vivo
Humanity's Last Exam
Un conjunto de preguntas creadas por expertos para situarse en la frontera del conocimiento humano; los modelos frontera actuales aún puntúan 40–60%. — ver datos en vivo
MMLU-Pro
El sucesor endurecido de MMLU: 14 categorías y opciones más difíciles para medir conocimiento académico amplio. — ver datos en vivo
Normalización min-max
Reescalar cualquier métrica bruta a 0–100 en todo el conjunto de modelos seguidos, para poder mezclar puntuaciones de distintas fuentes. 80 siempre significa «80% del camino del peor al mejor». — ver datos en vivo
Intervalo de confianza (±CI)
La incertidumbre estadística de un Elo de arena. Intervalos superpuestos significan que dos modelos están prácticamente empatados. — ver datos en vivo
$/M tokens
Precio por millón de tokens, citado por separado para entrada y salida. Los tokens de salida suelen ser 3–5× más caros que los de entrada. — ver datos en vivo