🤖 에이전트 랭킹
자율 도구 사용: OSWorld, Toolathlon, MCP Atlas, τ²-Bench.
🏆 종합673💻 코딩392📐 수학32🧠 추론391🤖 에이전트31📚 지식388👁️ 멀티모달370🛠️ 코딩 에이전트40🔬 과학 추론45🌍 다국어12✍️ 글쓰기53💬 채팅 어시스턴트53🔭 리서치48🔧 도구 호출31📜 긴 컨텍스트55⚡ 속도378💰 가성비377🔓 오픈 웨이트153
31개 모델
| # | 모델명 | Podium Score | 속도 |
|---|---|---|---|
| 01 | Kimi K3 Moonshot AI · 오픈소스 | 100.0 | 37 t/s |
| 02 | Claude Fable 5 Anthropic | 96.2 | 71 t/s |
| 03 | Gemini 3.5 Flash Google | 75.9 | 267 t/s |
| 4 | Claude Opus 4.8 Anthropic | 74.9 | 50 t/s |
| 5 | Claude Opus 4.7 Anthropic | 74.3 | 80 t/s |
| 6 | Qwen3.7 Max Alibaba | 71.5 | 203 t/s |
| 7 | MiMo V2.5 Pro Xiaomi · 오픈소스 | 69.0 | 65 t/s |
| 8 | GLM-5.2 Z.ai · 오픈소스 | 66.9 | 164 t/s |
| 9 | Gemini 3.1 Pro Google | 62.6 | 136 t/s |
| 10 | GPT-5.5 OpenAI | 61.1 | 60 t/s |
| 11 | Qwen3.7 Plus Alibaba | 59.0 | 54 t/s |
| 12 | Qwen3.6 Plus Alibaba | 52.6 | 55 t/s |
| 13 | Muse Spark Meta | 51.9 | 80 t/s |
| 14 | DeepSeek V4 Pro DeepSeek · 오픈소스 | 49.7 | 66 t/s |
| 15 | GPT-5.6 Luna OpenAI | 43.3 | 175 t/s |
| 16 | Claude Opus 4.6 Anthropic | 43.1 | 50 t/s |
| 17 | Kimi K2.7 Code Moonshot AI · 오픈소스 | 43.0 | 39 t/s |
| 18 | GPT-5.4 OpenAI | 41.6 | 60 t/s |
| 19 | Hunyuan Hy3 Tencent | 36.7 | 69 t/s |
| 20 | MiniMax M3 MiniMax | 35.4 | 93 t/s |
| 21 | DeepSeek V4 Flash DeepSeek · 오픈소스 | 35.3 | 113 t/s |
| 22 | GPT-5.6 Sol OpenAI | 33.9 | 72 t/s |
| 23 | GPT-5.6 Terra OpenAI | 30.7 | 127 t/s |
| 24 | Kimi K2.6 Moonshot AI · 오픈소스 | 26.3 | 40 t/s |
| 25 | Gemini 3 Pro Google | 24.1 | 120 t/s |
| 26 | GPT-5.2 OpenAI | 17.4 | 90 t/s |
| 27 | GPT-5.3 Codex OpenAI | 17.1 | 118 t/s |
| 28 | Gemini 3 Flash Google | 15.9 | 120 t/s |
| 29 | Claude Sonnet 4.6 Anthropic | 7.3 | 50 t/s |
| 30 | Qwen3.5 397B-A17B Alibaba · 오픈소스 | 0.0 | 71 t/s |
| 31 | Nemotron 3 Ultra 550B NVIDIA · 오픈소스 | 0.0 | 142 t/s |
Podium Score는 5개 리더보드의 가중 평균입니다. 자세한 내용은 평가 방법을 참고하세요.