👁️ Multimodal · llm-stats.com
ScreenSpot-Pro
GUI grounding on high-resolution professional application screens.
8
โมเดลที่ทดสอบ
Claude Opus 4.8
โมเดลเด่น
87.9%
คะแนนสูงสุด
Anthropic
ผู้ให้บริการ
| # | โมเดล | ScreenSpot-Pro |
|---|---|---|
| 1 | Claude Opus 4.8 Anthropic | 87.9% |
| 2 | GPT-5.2 OpenAI | 86.3% |
| 3 | Qwen3.8 Max Alibaba | 84.5% |
| 4 | Muse Spark Meta | 84.1% |
| 5 | Qwen3.7 Plus Alibaba | 79% |
| 6 | Gemini 3 Pro Google | 72.7% |
| 7 | Gemini 3 Flash Google | 69.1% |
| 8 | Qwen3.6 Plus Alibaba | 68.2% |
ข้อมูลเบนช์มาร์กรวบรวมจาก llm-stats.com ดู ระเบียบวิธี