👁️ Multimodal · llm-stats.com
CharXiv Reasoning
Reasoning over scientific charts and figures from arXiv papers.
12
Modelos probados
Claude Mythos Preview
Modelo destacado
93.2%
Mejor puntuación
Anthropic
Proveedor
| # | Modelo | CharXiv Reasoning |
|---|---|---|
| 1 | Claude Mythos Preview Anthropic | 93.2% |
| 2 | Kimi K3 Moonshot AI | 91.3% |
| 3 | Claude Opus 4.7 Anthropic | 91% |
| 4 | Claude Opus 4.8 Anthropic | 89.9% |
| 5 | Kimi K2.6 Moonshot AI | 86.7% |
| 6 | Muse Spark Meta | 86.4% |
| 7 | Qwen3.7 Plus Alibaba | 85.9% |
| 8 | GPT-5.2 OpenAI | 82.1% |
| 9 | Qwen3.6 Plus Alibaba | 81.5% |
| 10 | Gemini 3 Pro Google | 81.4% |
| 11 | Gemini 3 Flash Google | 80.3% |
| 12 | Claude Opus 4.6 Anthropic | 77.4% |
Datos agregados de llm-stats.com. Ver Metodología.