模型多维对比

支持最多选择4个模型,进行各项指标的横向对比。

评估指标Claude Mythos PreviewClaude Fable 5Kimi K3
提供商AnthropicAnthropicMoonshot AI
开源协议ProprietaryProprietaryOpen Weights
Podium 综合得分97.493.483.3
综合排名123
竞技场 Elo15091485
智商指数60.057.0
💻 Coding80.984.161.5
📐 Math100.070.9
🧠 Reasoning98.881.086.5
🤖 Agentic96.2100.0
📚 Knowledge100.043.319.7
👁️ Multimodal100.083.5
📜 Long Context99.299.2
⚡ Speed10.20.6
💰 Value71.492.4
生成速度80 t/s71 t/s37 t/s
首Token延迟141 ms3 ms
输入价格 ($/M)$3/M$10/M$3/M
输出价格 ($/M)$15/M$50/M$15/M
上下文窗口1000K1000K
SWE-Bench Verified93.9%95%
GPQA Diamond94.6%92.6%93.5%
Multilingual MMLU92.7%
Browsecomp86.9%91.2%
CharXiv Reasoning93.2%91.3%
Humanity’s Last Exam64.7%53.3%56%
SWE-Bench Pro77.8%
SciCode60.2%58.7%
LiveCodeBench70%74.7%
Ifbench63.5%
τ²-Bench Retail98.5%
Terminal-Bench Hard62.9%
MMMU-Pro81.6%
MCP Atlas84.2%
Toolathlon73.2%
Apex Agents37.6%
FrontierMath
MRCR v2
ScreenSpot-Pro
AIME 2025
ARC-AGI-2
OSWorld
SimpleQA
MMLU-Pro
Ifeval
MATH
Intelligence
Coding
Reasoning
Multimodal
Knowledge
Agents
Safety
Instruction
Value
Speed
Context
LongContext
Arena
MMMU
HumanEval