अगस्त 2026 तक मॉडल परिदृश्य का स्नैपशॉट, पूरी तरह हमारी रैंकिंग के पीछे के डेटा से लिया गया — 58 ट्रैक किए गए मॉडल, 25 बेंचमार्क, पाँच स्रोत रैंकिंग।
पोडियम का शीर्ष
Claude Mythos Preview 97.4 के साथ #1 पर बना हुआ है, इसके बाद Claude Fable 5 (93.4) और — पोडियम पर एकमात्र गैर-Anthropic मॉडल — Kimi K3 (83.3), जो हमारे द्वारा ट्रैक किया गया सबसे अच्छा ओपन-वेट मॉडल भी है। Anthropic शीर्ष पाँच में से चार स्थानों पर है।
ओपन-वेट अंतर: 14 अंक और घट रहा है
Kimi K3 का 83.3 मालिकाना फ्रंटियर से लगभग 14 Podium अंक नीचे है। LiveCodeBench पर यह कई बंद मॉडलों को हराता है जो दस गुना महँगे हैं। हालाँकि शीर्ष तीन ओपन मॉडलों के बाद, स्कोर 50 से नीचे गिर जाते हैं — ओपन मैदान वर्तमान में फ्रंटियर पर एक लैब गहरा है।
कीमतें: 178× का फैलाव
आउटपुट कीमतें $0.28/M (DeepSeek V4 Flash) से $50/M (Claude Fable 5) तक हैं। बाज़ार तीन स्तरों में विभाजित हो गया: उपयोगिता (<$1/M), कार्य-भार ($1–10/M) और फ्रंटियर ($25–50/M)। वैल्यू रैंकिंग दिखाती है कि प्रति-डॉलर बुद्धिमत्ता का स्वीट स्पॉट कार्य-भार स्तर में है।
गति: फ्लैश युद्ध
Google का Flash परिवार गति पोडियम पर छाया है — Gemini 3.5 Flash-Lite 389 टोकन/सेकंड पर — जबकि Meta का Muse Spark 1.1 ($4.25/M पर 208 t/s) वर्ष की सबसे अच्छी गति-प्रति-डॉलर कहानी है।
2026 किसने तय किया
एजेंटिक बेंचमार्कों ने चैट प्राथमिकता को युद्धभूमि के रूप में बदल दिया: SWE-Bench Verified (Fable 5 का 95%) और Terminal-Bench ने नेताओं को अलग किया, जबकि Humanity's Last Exam फ्रंटियर की छत बना हुआ है — कोई इसे आराम से पार नहीं करता। नए आमना-सामना पेजों पर कोई भी मुकाबला देखें।