评分方法
我们的综合排名系统将多个基准测试合并为一个可比较的分数。以下是其工作原理。
Composite Score
The composite score is a weighted average of all tracked benchmark results for each model.
Benchmark Categories
- Reasoning (35%) — MMLU, GPQA, AIME, MATH
- Coding (30%) — HumanEval, SWE-Bench, LiveCodeBench
- Chat (20%) — Arena ELO, IFEval
- Multimodal (15%) — MMMU