मॉडल तुलना

4 तक मॉडल चुनें और हम जो भी मेट्रिक ट्रैक करते हैं उन पर तुलना करें।

मेट्रिकClaude Mythos PreviewClaude Fable 5Kimi K3
प्रदाताAnthropicAnthropicMoonshot AI
लाइसेंसProprietaryProprietaryOpen Weights
Podium Score97.493.483.3
समग्र रैंक123
एरीना Elo15091485
Intelligence Index60.057.0
💻 Coding80.984.161.5
📐 Math100.070.9
🧠 Reasoning98.881.086.5
🤖 Agentic96.2100.0
📚 Knowledge100.043.319.7
👁️ Multimodal100.083.5
📜 Long Context99.299.2
⚡ Speed10.20.6
💰 Value71.492.4
गति80 t/s71 t/s37 t/s
पहले टोकन तक का समय141 ms3 ms
इनपुट कीमत ($/M)$3/M$10/M$3/M
आउटपुट कीमत ($/M)$15/M$50/M$15/M
कॉन्टेक्स्ट विंडो1000K1000K
SWE-Bench Verified93.9%95%
GPQA Diamond94.6%92.6%93.5%
Multilingual MMLU92.7%
Browsecomp86.9%91.2%
CharXiv Reasoning93.2%91.3%
Humanity’s Last Exam64.7%53.3%56%
SWE-Bench Pro77.8%
SciCode60.2%58.7%
LiveCodeBench70%74.7%
Ifbench63.5%
τ²-Bench Retail98.5%
Terminal-Bench Hard62.9%
MMMU-Pro81.6%
MCP Atlas84.2%
Toolathlon73.2%
Apex Agents37.6%
FrontierMath
MRCR v2
ScreenSpot-Pro
AIME 2025
ARC-AGI-2
OSWorld
SimpleQA
MMLU-Pro
Ifeval
MATH
Intelligence
Coding
Reasoning
Multimodal
Knowledge
Agents
Safety
Instruction
Value
Speed
Context
LongContext
Arena
MMMU
HumanEval