Rank
1
Model
glm-5zai
Overall
82.5
Runs
3
Usable Fit
100.0%
Zero-Shim Fit
90.5%
Total Cost
$0.22
Avg Cost/Case
$0.01
Failures
FORMAT_INVALID:1, TOOL_USAGE_FAIL:1
Agent runtime benchmark
The Hermes runtime fit benchmark tests whether models behave cleanly inside a soul-style persistent runtime loop. Usable Fit is the primary metric. Zero-Shim Fit is the stricter secondary metric and indicates cleaner operation without additional shim/orchestrator help.
| Model | Failures | |||||||
|---|---|---|---|---|---|---|---|---|
| 1 | glm-5zai | 82.5 | 3 | 100.0% | 90.5% | $0.22 | $0.01 | FORMAT_INVALID:1, TOOL_USAGE_FAIL:1 |
| 2 | gemini-3.5-flashgoogle | 79.8 | 1 | 100.0% | 85.7% | $0.09 | $0.01 | FORMAT_INVALID:1 |
| 3 | grok-4.5grok | 79.5 | 4 | 100.0% | 85.7% | $0.45 | $0.02 | TOOL_USAGE_FAIL:4 |
| 4 | kimi-k3moonshot | 78.7 | 1 | 100.0% | 85.7% | $0.33 | $0.05 | TOOL_USAGE_FAIL:1 |
| 5 | claude-fable-5anthropic | 78.4 | 2 | 100.0% | 85.7% | $1.59 | $0.11 | TOOL_USAGE_FAIL:2 |
| 6 | glm-5.1zai | 77.8 | 3 | 100.0% | 81.0% | $0.23 | $0.01 | TOOL_USAGE_FAIL:4 |
| 7 | gemini-3.1-pro-previewgoogle | 76.5 | 4 | 100.0% | 78.6% | $0.34 | $0.01 | TOOL_USAGE_FAIL:6 |
| 8 | grok-4.20-0309-reasoninggrok | 71.3 | 3 | 95.2% | 76.2% | $0.88 | $0.04 | TOOL_USAGE_FAIL:3, FORMAT_INVALID:1, MEMORY_PERSISTENCE_FAIL:1 |
| 9 | kimi-k2.5moonshot | 70.4 | 3 | 100.0% | 66.7% | $0.31 | $0.01 | TOOL_USAGE_FAIL:4, FORMAT_INVALID:3 |
| 10 | qwen3.7-plusqwen | 66.0 | 1 | 100.0% | 57.1% | $0.09 | $0.01 | TOOL_USAGE_FAIL:3 |
| 11 | kimi-k2.6moonshot | 65.4 | 3 | 95.2% | 52.4% | $0.43 | $0.02 | FORMAT_INVALID:5, TOOL_USAGE_FAIL:4, STRUCTURE_FAIL:1 |
| 12 | kimi-k2.7-code-highspeedmoonshot | 65.4 | 1 | 85.7% | 42.9% | $0.15 | $0.02 | TOOL_USAGE_FAIL:2, FORMAT_INVALID:1, STRUCTURE_FAIL:1 |
| 13 | claude-opus-5anthropic | 64.8 | 1 | 85.7% | 42.9% | $0.49 | $0.07 | FORMAT_INVALID:2, INTERRUPT_IGNORED:1, TOOL_USAGE_FAIL:1 |
| 14 | deepseek-v4-prodeepseek | 62.9 | 5 | 88.6% | 74.3% | $0.48 | $0.01 | TOOL_USAGE_FAIL:6, ACTION_LOOP_LIMIT:1, FORMAT_INVALID:1, MEMORY_PERSISTENCE_FAIL:1 |
| 15 | qwen3.6-plus-2026-04-02qwen | 61.7 | 3 | 85.7% | 66.7% | $0.38 | $0.02 | TOOL_USAGE_FAIL:4, MEMORY_PERSISTENCE_FAIL:2, TEST_FAIL:1 |
| 16 | grok-4.3grok | 61.1 | 4 | 89.3% | 75.0% | $0.39 | $0.01 | TOOL_USAGE_FAIL:4, FORMAT_INVALID:3 |
| 17 | gpt-5.6-solopenai | 59.9 | 1 | 85.7% | 71.4% | $0.23 | $0.03 | STRUCTURE_FAIL:1, TOOL_USAGE_FAIL:1 |
| 18 | claude-opus-4-7anthropic | 58.3 | 3 | 90.5% | 61.9% | $1.02 | $0.05 | FORMAT_INVALID:5, TOOL_USAGE_FAIL:3 |
| 19 | claude-sonnet-4-6anthropic | 58.2 | 20 | 80.0% | 80.0% | $2.55 | $0.03 | TEST_FAIL:12, STRUCTURE_FAIL:2, MEMORY_USE_FAIL:1, TOOL_USAGE_FAIL:1 |
| 20 | qwen3.6-max-previewqwen | 52.0 | 3 | 85.7% | 42.9% | $0.81 | $0.04 | TOOL_USAGE_FAIL:9, STRUCTURE_FAIL:2, TEST_FAIL:1 |
| 21 | claude-opus-4-8anthropic | 48.4 | 3 | 71.4% | 28.6% | $0.90 | $0.04 | FORMAT_INVALID:11, STRUCTURE_FAIL:4 |
| 22 | GPT-5.5openai | 45.2 | 4 | 67.9% | 46.4% | $1.08 | $0.04 | TOOL_USAGE_FAIL:7, STRUCTURE_FAIL:5, FORMAT_INVALID:3 |
| 23 | claude-opus-4-6anthropic | 44.3 | 3 | 85.7% | 14.3% | $0.71 | $0.03 | FORMAT_INVALID:18 |
| 24 | claude-sonnet-5anthropic | 41.6 | 1 | 57.1% | 42.9% | $0.32 | $0.05 | ACTION_LOOP_LIMIT:1, FORMAT_INVALID:1, STRUCTURE_FAIL:1, TOOL_USAGE_FAIL:1 |
| 25 | glm-5-turbozai | 39.0 | 4 | 60.7% | 39.3% | $0.18 | <$0.01 | TOOL_USAGE_FAIL:7, FORMAT_INVALID:5, STRUCTURE_FAIL:3, MEMORY_PERSISTENCE_FAIL:1, TEST_FAIL:1 |
| 26 | qwen3.5-plusqwen | 38.5 | 3 | 66.7% | 66.7% | $0.18 | <$0.01 | FORMAT_INVALID:3, TOOL_USAGE_FAIL:2, STRUCTURE_FAIL:1, TEST_FAIL:1 |
| 27 | gpt-5.4-xhighopenai | 34.8 | 3 | 57.1% | 28.6% | $2.12 | $0.10 | FORMAT_INVALID:14, STRUCTURE_FAIL:1 |
| 28 | gpt-5.6-lunaopenai | 23.9 | 1 | 42.9% | 28.6% | $0.06 | <$0.01 | FORMAT_INVALID:4, STRUCTURE_FAIL:1 |
| 29 | gpt-5.6-terraopenai | 23.6 | 1 | 57.1% | 42.9% | $0.09 | $0.01 | FORMAT_INVALID:4 |
| 30 | MiniMax-M2.7minimax | 17.8 | 3 | 33.3% | 0.0% | $0.06 | <$0.01 | FORMAT_INVALID:21 |
| 31 | gpt-5.2openai | 15.5 | 18 | 44.4% | 44.4% | $0.60 | <$0.01 | FORMAT_INVALID:24, STRUCTURE_FAIL:7, TOOL_USAGE_FAIL:3, MEMORY_USE_FAIL:1 |
| 32 | gpt-5.4openai | 14.1 | 20 | 44.6% | 34.9% | $0.77 | <$0.01 | FORMAT_INVALID:49, STRUCTURE_FAIL:4, MEMORY_USE_FAIL:1 |
| 33 | deepseek-chatdeepseek | 10.9 | 3 | 28.6% | 28.6% | $0.03 | <$0.01 | ACTION_LOOP_LIMIT:10, STRUCTURE_FAIL:3, FORBIDDEN_FILE_ATTEMPT:2 |
| 34 | gemini-3.1-flash-litegoogle | 4.3 | 3 | 33.3% | 33.3% | $0.04 | <$0.01 | TOOL_USAGE_FAIL:6, TEST_FAIL:4, STRUCTURE_FAIL:3, ACTION_LOOP_LIMIT:1 |
Numeric columns are sortable. Currency is rounded to two decimals for readability.
Runtime fit run counts vary by model based on accumulated runs; Overall score and usable/zero-shim percentages are the normalized comparison basis.