🧠 استدلال کے لیے بہترین AI ماڈلز
استدلال کی صلاحیت پر زبان کے ماڈلز کی درجہ بندی۔ اگست 2026 میں اپ ڈیٹ۔ آزاد بینچ مارک ڈیٹا پر مبنی۔
| # | ماڈل | فراہم کنندہ | اسکور | رفتار | قیمت (آؤٹ پٹ) |
|---|---|---|---|---|---|
| 1 | Claude Mythos Preview | Anthropic | 98.8 | 80 t/s | $15/M |
| 2 | GPT-5.6 Sol | OpenAI | 87.6 | 72 t/s | $30/M |
| 3 | Kimi K3 | Moonshot AI | 86.5 | 37 t/s | $15/M |
| 4 | Claude Opus 4.8 | Anthropic | 82.8 | 50 t/s | $15/M |
| 5 | Claude Opus 5 | Anthropic | 82.3 | 60 t/s | $25/M |
| 6 | Claude Fable 5 | Anthropic | 81.0 | 71 t/s | $50/M |
| 7 | GPT-5.5 | OpenAI | 80.4 | 60 t/s | $10/M |
| 8 | Gemini 3.1 Pro | 73.5 | 136 t/s | $12/M | |
| 9 | Claude Opus 4.7 | Anthropic | 73.3 | 80 t/s | $15/M |
| 10 | Claude Mythos 5 | Anthropic | 71.0 | 50 t/s | $50/M |
| 11 | GPT-5.6 Terra | OpenAI | 69.6 | 127 t/s | $12/M |
| 12 | Gemini 3.5 Flash | 66.5 | 267 t/s | $9/M | |
| 13 | Qwen3.8 Max | Alibaba | 66.3 | 55 t/s | $2/M |
| 14 | Claude Opus 4.6 | Anthropic | 66.0 | 50 t/s | $15/M |
| 15 | Gemini 3.6 Flash | 65.7 | 233 t/s | $7.5/M | |
| 16 | GLM-5.2 | Z.ai | 65.6 | 164 t/s | $4.29/M |
| 17 | MiniMax M3 | MiniMax | 64.8 | 93 t/s | $1.2/M |
| 18 | GPT-5.3 Codex | OpenAI | 62.9 | 118 t/s | $14/M |
| 19 | Muse Spark 1.1 | Meta | 62.7 | 208 t/s | $4.25/M |
| 20 | GLM-5.1 | Z.ai | 62.0 | 74 t/s | $4.4/M |
Top 5 \u2014 فوری موازنہ
طریقہ کار
درجہ بندیاں آزاد بینچ مارک جانچ پر مبنی ہیں۔ اسکور کئی معیاری بینچ مارکس سے نکالا جاتا ہے اور 0–100 پر معمول کیا جاتا ہے۔