Coding on Terminal-Bench 1.1
43Resolved RateSpell GPT-5.4
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Spell GPT-5.4Config=:coding, Effort=high2026.05 | 43 | 37.88 | 6,480,000 | |
| Codex CLI GPT-5.4Config=default, Effort=high2026.05 | 43 | 83.86 | 94,650,000 | |
| Spell GPT-5.4Config=default, Effort=high2026.05 | 40 | 40.72 | 6,520,000 | |
| Spell GPT-5.4Config=:coding, Effort=medium2026.05 | 40 | 27.36 | 10,210,000 | |
| Codex CLI GPT-5.4Config=default, Effort=medium2026.05 | 39 | 46.96 | 51,140,000 | |
| Codex CLI GPT-5.4Config=default, Effort=low2026.05 | 38 | 39.43 | 39,930,000 | |
| Spell GPT-5.4Config=default, Effort=medium2026.05 | 36 | 25.72 | 6,960,000 | |
| Spell GPT-5.4Config=default, Effort=low2026.05 | 35 | 12.26 | 10,110,000 | |
| Spell GPT-5.4Config=:coding, Effort=low2026.05 | 35 | 19.11 | 22,510,000 |