🤖 Agentic · source: llm-stats.com
Toolathlon
Multi-tool orchestration tasks across real-world APIs.
16
Models Tested
Kimi K3
Top Model
73.2%
Top Score
Moonshot AI
Provider
| # | Model | Toolathlon |
|---|---|---|
| 1 | Kimi K3 Moonshot AI | 73.2% |
| 2 | Claude Opus 4.8 Anthropic | 59.9% |
| 3 | GPT-5.6 Sol OpenAI | 58% |
| 4 | GPT-5.5 OpenAI | 55.6% |
| 5 | GPT-5.4 OpenAI | 54.6% |
| 6 | GPT-5.6 Luna OpenAI | 53.4% |
| 7 | GPT-5.6 Terra OpenAI | 53.1% |
| 8 | DeepSeek V4 Pro DeepSeek | 51.8% |
| 9 | Kimi K2.6 Moonshot AI | 50% |
| 10 | Gemini 3 Flash Google | 49.4% |
| 11 | Hunyuan Hy3 Tencent | 48.5% |
| 12 | GLM-5.2 Z.ai | 48.2% |
| 13 | DeepSeek V4 Flash DeepSeek | 47.8% |
| 14 | GPT-5.2 OpenAI | 46.3% |
| 15 | Qwen3.6 Plus Alibaba | 39.8% |
| 16 | Qwen3.5 397B-A17B Alibaba | 38.3% |
Benchmark data aggregated from llm-stats.com. See Methodology for details.