Un’istantanea del panorama dei modelli all’agosto 2026, tratta interamente dai dati della nostra classifica — 58 modelli monitorati, 25 benchmark, cinque classifiche fonte.
La vetta del podio
Claude Mythos Preview mantiene il #1 con 97.4, seguito da Claude Fable 5 (93.4) e — l’unico modello non-Anthropic sul podio — Kimi K3 (83.3), che è anche il miglior modello open-weight che monitoriamo. Anthropic occupa quattro delle prime cinque posizioni.
Il divario open-weight: 14 punti e in calo
I 83.3 di Kimi K3 sono circa 14 punti Podium sotto la frontiera proprietaria. Su LiveCodeBench batte diversi modelli chiusi che costano dieci volte di più. Dopo i primi tre modelli aperti, però, i punteggi scendono sotto 50 — il campo aperto ha oggi un solo laboratorio in frontiera.
Prezzi: una forbice di 178×
I prezzi di uscita vanno da $0.28/M (DeepSeek V4 Flash) a $50/M (Claude Fable 5). Il mercato si è segmentato in tre livelli: utility (<$1/M), lavoro ($1–10/M) e frontier ($25–50/M). La classifica valore mostra che il punto ideale intelligenza-per-dollaro è nel livello lavoro.
Velocità: la guerra dei flash
La famiglia Flash di Google occupa l’intero podio della velocità — Gemini 3.5 Flash-Lite a 389 token/secondo — mentre il Muse Spark 1.1 di Meta (208 t/s a $4.25/M) è la migliore storia velocità-per-dollaro dell’anno.
Cosa ha deciso il 2026
I benchmark agentici hanno sostituito la preferenza in chat come campo di battaglia: SWE-Bench Verified (Fable 5 al 95%) e Terminal-Bench hanno separato i leader, mentre Humanity's Last Exam resta il soffitto della frontiera — nessuno lo supera agevolmente. Esplora qualsiasi sfida nelle nuove pagine di confronto diretto.