💻 Coding · llm-stats.com

HumanEval

Function-level Python completion, the classic code-generation benchmark.

1
Model diuji
GPT-5
Model teratas
93.4%
Skor terbaik
OpenAI
Penyedia
#ModelHumanEvalPenyediaPodium Score
1
GPT-5
OpenAI
93.4%
OpenAI23.0
Data benchmark digabungkan dari llm-stats.com. Selengkapnya di metodologi.