Report

Stato degli LLM 2026: il rapporto del podio

Un’istantanea del panorama dei modelli all’agosto 2026, tratta interamente dai dati della nostra classifica — 58 modelli monitorati, 25 benchmark, cinque classifiche fonte.

La vetta del podio

Claude Mythos Preview mantiene il #1 con 97.4, seguito da Claude Fable 5 (93.4) e — l’unico modello non-Anthropic sul podio — Kimi K3 (83.3), che è anche il miglior modello open-weight che monitoriamo. Anthropic occupa quattro delle prime cinque posizioni.

Il divario open-weight: 14 punti e in calo

I 83.3 di Kimi K3 sono circa 14 punti Podium sotto la frontiera proprietaria. Su LiveCodeBench batte diversi modelli chiusi che costano dieci volte di più. Dopo i primi tre modelli aperti, però, i punteggi scendono sotto 50 — il campo aperto ha oggi un solo laboratorio in frontiera.

Prezzi: una forbice di 178×

I prezzi di uscita vanno da $0.28/M (DeepSeek V4 Flash) a $50/M (Claude Fable 5). Il mercato si è segmentato in tre livelli: utility (<$1/M), lavoro ($1–10/M) e frontier ($25–50/M). La classifica valore mostra che il punto ideale intelligenza-per-dollaro è nel livello lavoro.

Velocità: la guerra dei flash

La famiglia Flash di Google occupa l’intero podio della velocità — Gemini 3.5 Flash-Lite a 389 token/secondo — mentre il Muse Spark 1.1 di Meta (208 t/s a $4.25/M) è la migliore storia velocità-per-dollaro dell’anno.

Cosa ha deciso il 2026

I benchmark agentici hanno sostituito la preferenza in chat come campo di battaglia: SWE-Bench Verified (Fable 5 al 95%) e Terminal-Bench hanno separato i leader, mentre Humanity's Last Exam resta il soffitto della frontiera — nessuno lo supera agevolmente. Esplora qualsiasi sfida nelle nuove pagine di confronto diretto.

← Tutti gli Articoli