Terminal Task Execution on Terminal-Bench 2.0
59.6Success RateHarnessBridge-D
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HarnessBridge-DGenerator=DeepSeek-V4-Pro2026.06 | 59.6 | 0.98 | |
| Terminus 2Generator=DeepSeek-V4-Pro2026.06 | 57.3 | 1.02 | |
| Terminus 2Generator=GPT-5.42026.06 | 53.9 | 9.41 | |
| HarnessBridge-DGenerator=GPT-5.42026.06 | 52.8 | 0.51 | |
| HarnessBridge-DGenerator=DeepSeek-V4-Flash2026.06 | 51.7 | 0.92 | |
| Terminus 2Generator=DeepSeek-V4-Flash2026.06 | 49.4 | 2.18 | |
| HarnessBridge-DGenerator=GPT-5.4-Nano2026.06 | 23.6 | 1 | |
| Terminus 2Generator=GPT-5.4-Nano2026.06 | 18 | 9.8 | |
| OT-Agent-ColdSFT+RL-8BBase Model=OpenThinker-Agent-v1-SFT, Train Size=10K+5K, Training Method=SFT+RL2026.06 | 13.5 | — | |
| Nemotron-Terminal-8BTrain Size=264K, Training Method=SFT2026.06 | 13.1 | — | |
| OT-Agent-SFT-8B (100K)Base Model=OpenThinker-Agent-v1-SFT, Train Size=100K, Training Method=SFT2026.06 | 10.9 | — | |
| Endless TerminalsBase Model=Qwen3-8B, Train Size=15K+3K, Training Method=SFT+RL2026.06 | 8.2 | — | |
| OT-Agent-SFT-8B (10K)Base Model=OpenThinker-Agent-v1-SFT, Train Size=10K, Training Method=SFT2026.06 | 7.9 | — | |
| Qwen3-8BBase Model=N/A, Train Size=N/A, Training Method=N/A2026.06 | 2.2 | — | |
| SWE-Lego-Qwen3-8BBase Model=Qwen3-8B, Train Size=18K, Training Method=SFT2026.06 | 0.7 | — |