💻 Coding · source: llmbase.ai

Terminal-Bench Hard

Multi-step command-line tasks in realistic terminal environments.

19
Models Tested
GPT-5.6 Sol
Top Model
65.9%
Top Score
OpenAI
Provider
#ModelTerminal-Bench HardProviderPodium Score
1
65.9%
OpenAI80.8
2
62.9%
Anthropic93.4
3
GPT-5.5
OpenAI
60.6%
OpenAI54.0
4
58.3%
Anthropic76.0
5
57.6%
OpenAI66.4
6
53.8%
Google60.6
7
53%
OpenAI52.4
8
50.8%
Z.ai59.1
9
50.8%
Alibaba51.0
10
48.5%
Anthropic61.2
11
45.5%
Meta47.0
12
Kimi K2.7 Code
Moonshot AI
44.7%
Moonshot AI41.8
13
43.9%
Alibaba32.4
14
43.2%
Xiaomi48.0
15
MiniMax M3
MiniMax
42.4%
MiniMax39.6
16
41.7%
Google51.9
17
40.9%
Google50.0
18
36.4%
DeepSeek46.0
19
36.4%
NVIDIA19.0
Benchmark data aggregated from llmbase.ai. See Methodology for details.