Benchmark
IFEval
Instruction Following Evaluation
Strict instruction-following compliance across formatting and constraint tasks.
25
Models Tested
Claude Opus 4
Top Model
94.2%
Top Score
100 %
Max Possible
| # | Model | IFEval Score |
|---|---|---|
| 1 | Claude Opus 4 Anthropic | 94.2% |
| 2 | o3 OpenAI | 92.8% |
| 3 | Gemini 2.5 Pro Google | 92.3% |
| 4 | Claude Sonnet 4 Anthropic | 90.1% |
| 5 | o4-mini OpenAI | 89.5% |
| 6 | DeepSeek R1 DeepSeek | 88.3% |
| 7 | Grok 3 xAI | 87.8% |
| 8 | Llama 4 Maverick Meta | 87.4% |
| 9 | DeepSeek V3 DeepSeek | 86.7% |
| 10 | Claude 3.5 Sonnet Anthropic | 86.5% |
| 11 | GPT-4o OpenAI | 86.1% |
| 12 | Gemini 2.5 Flash Google | 85.7% |
| 13 | Qwen 3 235B Alibaba | 85.2% |
| 14 | Llama 3.1 405B Meta | 84.3% |
| 15 | Llama 3.3 70B Meta | 83.5% |
| 16 | Gemini 2.0 Flash Google | 83.2% |
| 17 | GPT-4o Mini OpenAI | 82.4% |
| 18 | Claude 3.5 Haiku Anthropic | 82.1% |
| 19 | Mistral Large Mistral AI | 81.2% |
| 20 | Qwen 2.5 72B Alibaba | 80.1% |
| 21 | Llama 3.1 70B Meta | 79.8% |
| 22 | Grok 2 xAI | 78.5% |
| 23 | Mixtral 8x22B Mistral AI | 75.3% |
| 24 | Command R+ Cohere | 72.5% |
| 25 | Phi-4 Microsoft | 70.2% |
Source: Zhou et al., 2023