🧠 Reasoning · llm-stats.com
Humanity’s Last Exam
Thousands of expert-written questions across dozens of fields, the hardest closed-ended academic benchmark in wide use.
40
テスト済みモデル
Claude Mythos Preview
トップモデル
64.7%
トップスコア
Anthropic
プロバイダー
| # | モデル | Humanity’s Last Exam |
|---|---|---|
| 1 | Claude Mythos Preview Anthropic | 64.7% |
| 2 | Muse Spark Meta | 58.4% |
| 3 | Claude Opus 4.8 Anthropic | 57.9% |
| 4 | Kimi K3 Moonshot AI | 56% |
| 5 | GLM-5.2 Z.ai | 54.7% |
| 6 | Claude Opus 4.7 Anthropic | 54.7% |
| 7 | Claude Fable 5 Anthropic | 53.3% |
| 8 | Claude Opus 4.6 Anthropic | 53.1% |
| 9 | Claude Opus 5 Anthropic | 52.6% |
| 10 | GPT-5.5 OpenAI | 52.2% |
| 11 | Gemini 3.1 Pro Google | 51.4% |
| 12 | Grok 4 Heavy xAI | 50.7% |
| 13 | Claude Sonnet 4.6 Anthropic | 49% |
| 14 | DeepSeek V4 Pro DeepSeek | 48.2% |
| 15 | GPT-5.6 Sol OpenAI | 47.2% |
| 16 | Gemini 3 Pro Google | 45.8% |
| 17 | Muse Spark 1.1 Meta | 45.1% |
| 18 | DeepSeek V4 Flash DeepSeek | 45.1% |
| 19 | Qwen3.8 Max Alibaba | 43.6% |
| 20 | Gemini 3 Flash Google | 43.5% |
| 21 | GPT-5.6 Terra OpenAI | 41.8% |
| 22 | Qwen3.7 Max Alibaba | 41.4% |
| 23 | Gemini 3.5 Flash Google | 41% |
| 24 | Grok 4.5 xAI | 40.3% |
| 25 | GPT-5.3 Codex OpenAI | 39.9% |
| 26 | GPT-5.4 OpenAI | 39.8% |
| 27 | Gemini 3.6 Flash Google | 38.3% |
| 28 | GPT-5.6 Luna OpenAI | 37.2% |
| 29 | MiniMax M3 MiniMax | 37.1% |
| 30 | Kimi K2.6 Moonshot AI | 36.4% |
| 31 | Qwen3.7 Plus Alibaba | 34.7% |
| 32 | GPT-5.2 OpenAI | 34.5% |
| 33 | MiMo V2.5 Pro Xiaomi | 33.8% |
| 34 | Kimi K2.7 Code Moonshot AI | 32.8% |
| 35 | Hunyuan Hy3 Tencent | 31.6% |
| 36 | Inkling Thinking Machines | 29.7% |
| 37 | Qwen3.6 Plus Alibaba | 28.8% |
| 38 | Qwen3.5 397B-A17B Alibaba | 28.7% |
| 39 | Nemotron 3 Ultra 550B NVIDIA | 26.6% |
| 40 | Claude Sonnet 5 Anthropic | 17.8% |
ベンチマークデータは llm-stats.com から集計。詳細は方法論。