Code Agent on Terminal-Bench Hard
57.6ScoreGPT-5.4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.4Source=artificialanalysis.ai2026.03 | 57.6 | |
| Gemini 3.1 ProSource=artificialanalysis.ai2026.03 | 53.8 | |
| KAT-Coder-V2Evaluation Environment=KwaiEnv2026.03 | 46.8 | |
| Claude Opus 4.6Source=artificialanalysis.ai2026.03 | 46.2 | |
| GLM-5Source=artificialanalysis.ai2026.03 | 43.2 | |
| MiniMax M2.7Source=artificialanalysis.ai2026.03 | 39.4 | |
| Gemini-3.0 ProVariant=Pro2026.01 | 39 | |
| DeepSeek-V3.2 ThinkingThinking Mode=true2026.01 | 35.4 | |
| Claude Sonnet 4.5Variant=Sonnet 4.52026.01 | 33.3 | |
| Kimi-K2 ThinkingThinking Mode=true2026.01 | 30.6 | |
| MiMo-V2-FlashVariant=Flash2026.01 | 30.5 | |
| GPT-5 HighVariant=High2026.01 | 30.5 |