Model Comparison

Pick up to 4 models and compare them across every metric we track.

MetricClaude Mythos PreviewClaude Fable 5Kimi K3
ProviderAnthropicAnthropicMoonshot AI
LicenseProprietaryProprietaryOpen Weights
Podium Score97.493.483.3
Overall rank123
Arena Eloโ€”15091485
Intelligence Indexโ€”60.057.0
๐Ÿ’ป Coding80.984.161.5
๐Ÿ“ Math100.0โ€”70.9
๐Ÿง  Reasoning98.881.086.5
๐Ÿค– Agenticโ€”96.2100.0
๐Ÿ“š Knowledge100.043.319.7
๐Ÿ‘๏ธ Multimodal100.0โ€”83.5
๐Ÿ“œ Long Contextโ€”99.299.2
โšก Speedโ€”10.20.6
๐Ÿ’ฐ Valueโ€”71.492.4
Speed80 t/s71 t/s37 t/s
Time to First Tokenโ€”141 ms3 ms
Input Price ($/M)$3/M$10/M$3/M
Output Price ($/M)$15/M$50/M$15/M
Context Windowโ€”1000K1000K
SWE-Bench Verified93.9%95%โ€”
GPQA Diamond94.6%92.6%93.5%
Multilingual MMLU92.7%โ€”โ€”
Browsecomp86.9%โ€”91.2%
CharXiv Reasoning93.2%โ€”91.3%
Humanityโ€™s Last Exam64.7%53.3%56%
SWE-Bench Pro77.8%โ€”โ€”
SciCodeโ€”60.2%58.7%
LiveCodeBenchโ€”70%74.7%
Ifbenchโ€”63.5%โ€”
ฯ„ยฒ-Bench Retailโ€”98.5%โ€”
Terminal-Bench Hardโ€”62.9%โ€”
MMMU-Proโ€”โ€”81.6%
MCP Atlasโ€”โ€”84.2%
Toolathlonโ€”โ€”73.2%
Apex Agentsโ€”โ€”37.6%
FrontierMathโ€”โ€”โ€”
MRCR v2โ€”โ€”โ€”
ScreenSpot-Proโ€”โ€”โ€”
AIME 2025โ€”โ€”โ€”
ARC-AGI-2โ€”โ€”โ€”
OSWorldโ€”โ€”โ€”
SimpleQAโ€”โ€”โ€”
MMLU-Proโ€”โ€”โ€”
Ifevalโ€”โ€”โ€”
MATHโ€”โ€”โ€”
Intelligenceโ€”โ€”โ€”
Codingโ€”โ€”โ€”
Reasoningโ€”โ€”โ€”
Multimodalโ€”โ€”โ€”
Knowledgeโ€”โ€”โ€”
Agentsโ€”โ€”โ€”
Safetyโ€”โ€”โ€”
Instructionโ€”โ€”โ€”
Valueโ€”โ€”โ€”
Speedโ€”โ€”โ€”
Contextโ€”โ€”โ€”
LongContextโ€”โ€”โ€”
Arenaโ€”โ€”โ€”
MMMUโ€”โ€”โ€”
HumanEvalโ€”โ€”โ€”