Agent runtime benchmark

OpenClaw Benchmark Leaderboard

The OpenClaw runtime fit benchmark tests whether models behave cleanly inside an agent-style persistent runtime loop. Usable Fit is the primary metric. Zero-Shim Fit is the stricter secondary metric and indicates cleaner operation without additional shim/orchestrator help.

Showing 36 of 36
Rank
1
Model
gemini-3.5-flashgoogle
Overall
79.7
Runs
1
Usable Fit
100.0%
Zero-Shim Fit
85.7%
Total Cost
$0.10
Avg Cost/Case
$0.01
Failures
FORMAT_INVALID:1
Rank
2
Model
kimi-k3moonshot
Overall
78.6
Runs
1
Usable Fit
100.0%
Zero-Shim Fit
85.7%
Total Cost
$0.36
Avg Cost/Case
$0.05
Failures
TOOL_USAGE_FAIL:1
Rank
3
Model
claude-opus-5anthropic
Overall
78.5
Runs
1
Usable Fit
85.7%
Zero-Shim Fit
71.4%
Total Cost
$0.49
Avg Cost/Case
$0.07
Failures
STRUCTURE_FAIL:1, TOOL_USAGE_FAIL:1
Rank
4
Model
claude-fable-5anthropic
Overall
78.4
Runs
2
Usable Fit
100.0%
Zero-Shim Fit
85.7%
Total Cost
$1.55
Avg Cost/Case
$0.11
Failures
FORMAT_INVALID:2
Rank
5
Model
grok-4.5grok
Overall
77.6
Runs
4
Usable Fit
100.0%
Zero-Shim Fit
82.1%
Total Cost
$0.52
Avg Cost/Case
$0.02
Failures
TOOL_USAGE_FAIL:4, FORMAT_INVALID:1
Rank
6
Model
gemini-3.1-pro-previewgoogle
Overall
74.9
Runs
5
Usable Fit
100.0%
Zero-Shim Fit
75.9%
Total Cost
$0.33
Avg Cost/Case
$0.01
Failures
TOOL_USAGE_FAIL:7
Rank
7
Model
glm-5zai
Overall
74.1
Runs
5
Usable Fit
95.7%
Zero-Shim Fit
87.0%
Total Cost
$0.21
Avg Cost/Case
<$0.01
Failures
TOOL_USAGE_FAIL:3
Rank
8
Model
claude-opus-4-7anthropic
Overall
73.4
Runs
3
Usable Fit
95.2%
Zero-Shim Fit
81.0%
Total Cost
$0.93
Avg Cost/Case
$0.04
Failures
TOOL_USAGE_FAIL:3, TEST_FAIL:1
Rank
9
Model
kimi-k2.7-code-highspeedmoonshot
Overall
72.3
Runs
1
Usable Fit
85.7%
Zero-Shim Fit
57.1%
Total Cost
$0.15
Avg Cost/Case
$0.02
Failures
FORMAT_INVALID:2, STRUCTURE_FAIL:1
Rank
10
Model
qwen3.7-plusqwen
Overall
65.9
Runs
1
Usable Fit
100.0%
Zero-Shim Fit
57.1%
Total Cost
$0.09
Avg Cost/Case
$0.01
Failures
TOOL_USAGE_FAIL:3
Rank
11
Model
kimi-k2.6moonshot
Overall
65.4
Runs
3
Usable Fit
95.2%
Zero-Shim Fit
52.4%
Total Cost
$0.48
Avg Cost/Case
$0.02
Failures
FORMAT_INVALID:9, STRUCTURE_FAIL:1
Rank
12
Model
grok-4.3grok
Overall
63.0
Runs
4
Usable Fit
85.7%
Zero-Shim Fit
78.6%
Total Cost
$0.39
Avg Cost/Case
$0.01
Failures
FORMAT_INVALID:3, MEMORY_PERSISTENCE_FAIL:1, STRUCTURE_FAIL:1, TOOL_USAGE_FAIL:1
Rank
13
Model
kimi-k2.5moonshot
Overall
60.1
Runs
4
Usable Fit
92.9%
Zero-Shim Fit
57.1%
Total Cost
$0.40
Avg Cost/Case
$0.01
Failures
FORMAT_INVALID:7, TOOL_USAGE_FAIL:4, STRUCTURE_FAIL:1
Rank
14
Model
gpt-5.6-solopenai
Overall
59.9
Runs
1
Usable Fit
85.7%
Zero-Shim Fit
71.4%
Total Cost
$0.24
Avg Cost/Case
$0.03
Failures
STRUCTURE_FAIL:1, TOOL_USAGE_FAIL:1
Rank
15
Model
gpt-5.2openai
Overall
58.0
Runs
405
Usable Fit
73.4%
Zero-Shim Fit
65.2%
Total Cost
$2.06
Avg Cost/Case
<$0.01
Failures
FORMAT_INVALID:68, BUDGET_EXCEEDED:40, INTERRUPT_IGNORED:30, STRUCTURE_FAIL:13, TOOL_USAGE_FAIL:3, FORBIDDEN_TOOL_ATTEMPT:1, MEMORY_PERSISTENCE_FAIL:1, MEMORY_USE_FAIL:1
Rank
16
Model
glm-5-turbozai
Overall
56.7
Runs
4
Usable Fit
85.7%
Zero-Shim Fit
60.7%
Total Cost
$0.18
Avg Cost/Case
<$0.01
Failures
TOOL_USAGE_FAIL:9, TEST_FAIL:2
Rank
17
Model
deepseek-v4-prodeepseek
Overall
56.4
Runs
4
Usable Fit
82.1%
Zero-Shim Fit
75.0%
Total Cost
$0.31
Avg Cost/Case
$0.01
Failures
TOOL_USAGE_FAIL:3, FORBIDDEN_TOOL_ATTEMPT:1, FORMAT_INVALID:1, MEMORY_PERSISTENCE_FAIL:1, STRUCTURE_FAIL:1
Rank
18
Model
claude-sonnet-4-6anthropic
Overall
55.7
Runs
21
Usable Fit
78.0%
Zero-Shim Fit
76.8%
Total Cost
$2.60
Avg Cost/Case
$0.03
Failures
TEST_FAIL:11, STRUCTURE_FAIL:4, TOOL_USAGE_FAIL:3, MEMORY_USE_FAIL:1
Rank
19
Model
claude-opus-4-8anthropic
Overall
54.3
Runs
3
Usable Fit
90.5%
Zero-Shim Fit
38.1%
Total Cost
$0.94
Avg Cost/Case
$0.04
Failures
FORMAT_INVALID:12, STRUCTURE_FAIL:1
Rank
20
Model
grok-4.20-0309-reasoninggrok
Overall
53.4
Runs
4
Usable Fit
81.8%
Zero-Shim Fit
63.6%
Total Cost
$0.97
Avg Cost/Case
$0.04
Failures
TOOL_USAGE_FAIL:4, MEMORY_PERSISTENCE_FAIL:3, FORMAT_INVALID:1
Rank
21
Model
glm-5.1zai
Overall
52.7
Runs
3
Usable Fit
81.0%
Zero-Shim Fit
66.7%
Total Cost
$0.22
Avg Cost/Case
$0.01
Failures
TOOL_USAGE_FAIL:3, FORBIDDEN_FILE_ATTEMPT:2, FORMAT_INVALID:1, TEST_FAIL:1
Rank
22
Model
qwen3.5-plusqwen
Overall
50.9
Runs
4
Usable Fit
72.7%
Zero-Shim Fit
72.7%
Total Cost
$0.19
Avg Cost/Case
<$0.01
Failures
FORMAT_INVALID:2, STRUCTURE_FAIL:2, MEMORY_PERSISTENCE_FAIL:1, TEST_FAIL:1
Rank
23
Model
qwen3.6-plus-2026-04-02qwen
Overall
47.9
Runs
3
Usable Fit
76.2%
Zero-Shim Fit
57.1%
Total Cost
$0.38
Avg Cost/Case
$0.02
Failures
TOOL_USAGE_FAIL:5, MEMORY_PERSISTENCE_FAIL:3, TEST_FAIL:1
Rank
24
Model
claude-opus-4-6anthropic
Overall
44.2
Runs
3
Usable Fit
85.7%
Zero-Shim Fit
14.3%
Total Cost
$0.78
Avg Cost/Case
$0.04
Failures
FORMAT_INVALID:18
Rank
25
Model
glm-5.2zai
Overall
43.4
Runs
1
Usable Fit
71.4%
Zero-Shim Fit
57.1%
Total Cost
$0.14
Avg Cost/Case
$0.02
Failures
TOOL_USAGE_FAIL:2, STRUCTURE_FAIL:1
Rank
26
Model
GPT-5.5openai
Overall
41.1
Runs
4
Usable Fit
71.4%
Zero-Shim Fit
60.7%
Total Cost
$1.14
Avg Cost/Case
$0.04
Failures
FORMAT_INVALID:6, TOOL_USAGE_FAIL:4, STRUCTURE_FAIL:1
Rank
27
Model
gpt-5.6-terraopenai
Overall
35.4
Runs
1
Usable Fit
71.4%
Zero-Shim Fit
42.9%
Total Cost
$0.09
Avg Cost/Case
$0.01
Failures
FORMAT_INVALID:4
Rank
28
Model
qwen3.6-max-previewqwen
Overall
33.9
Runs
3
Usable Fit
66.7%
Zero-Shim Fit
57.1%
Total Cost
$0.36
Avg Cost/Case
$0.02
Failures
TOOL_USAGE_FAIL:4, STRUCTURE_FAIL:3, FORMAT_INVALID:1, TEST_FAIL:1
Rank
29
Model
claude-sonnet-5anthropic
Overall
28.7
Runs
1
Usable Fit
57.1%
Zero-Shim Fit
42.9%
Total Cost
$0.32
Avg Cost/Case
$0.05
Failures
STRUCTURE_FAIL:2, FORMAT_INVALID:1, TOOL_USAGE_FAIL:1
Rank
30
Model
gemma-4-31b-itgoogle
Overall
28.6
Runs
3
Usable Fit
57.1%
Zero-Shim Fit
0.0%
Total Cost
$0.00
Avg Cost/Case
$0.00
Failures
FORMAT_INVALID:21
Rank
31
Model
MiniMax-M2.7minimax
Overall
25.2
Runs
4
Usable Fit
50.0%
Zero-Shim Fit
0.0%
Total Cost
$0.07
Avg Cost/Case
<$0.01
Failures
FORMAT_INVALID:22
Rank
32
Model
gpt-5.4-xhighopenai
Overall
24.9
Runs
4
Usable Fit
46.4%
Zero-Shim Fit
28.6%
Total Cost
$2.25
Avg Cost/Case
$0.08
Failures
FORMAT_INVALID:16, STRUCTURE_FAIL:4
Rank
33
Model
gpt-5.4openai
Overall
19.5
Runs
39
Usable Fit
54.4%
Zero-Shim Fit
28.2%
Total Cost
$0.83
Avg Cost/Case
<$0.01
Failures
FORMAT_INVALID:67, STRUCTURE_FAIL:4, TOOL_USAGE_FAIL:2, MEMORY_USE_FAIL:1
Rank
34
Model
gemini-3.1-flash-litegoogle
Overall
13.6
Runs
3
Usable Fit
42.9%
Zero-Shim Fit
38.1%
Total Cost
$0.04
Avg Cost/Case
<$0.01
Failures
TOOL_USAGE_FAIL:6, ACTION_LOOP_LIMIT:3, STRUCTURE_FAIL:3, TEST_FAIL:1
Rank
35
Model
deepseek-chatdeepseek
Overall
10.8
Runs
4
Usable Fit
22.7%
Zero-Shim Fit
22.7%
Total Cost
$0.03
Avg Cost/Case
<$0.01
Failures
ACTION_LOOP_LIMIT:10, STRUCTURE_FAIL:3, FORBIDDEN_FILE_ATTEMPT:2, TEST_FAIL:2
Rank
36
Model
gpt-5.6-lunaopenai
Overall
9.5
Runs
1
Usable Fit
42.9%
Zero-Shim Fit
42.9%
Total Cost
$0.08
Avg Cost/Case
$0.01
Failures
FORMAT_INVALID:4

Numeric columns are sortable. Currency is rounded to two decimals for readability.

Runtime fit run counts vary by model based on accumulated runs; Overall score and usable/zero-shim percentages are the normalized comparison basis.