Shell-based agent task completion on Terminal-Bench V2
86.5AccuracyLLM-as-a-Verifier
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLM-as-a-VerifierVerifier=Gemini 2.5 Flash, Generation Policy=GPT-5.5, Scaffold=Capy2026.07 | 86.5 | — | — | |
| GPT-5.5Baseline Rank=#12026.07 | 84.7 | — | — | |
| Opus 4.7Baseline Rank=#22026.07 | 80.2 | — | — | |
| G3.1 ProBaseline Rank=#32026.07 | 80.2 | — | — | |
| GPT-5.5 (Candidate Pool)Scaffold=Capy2026.07 | — | 83.1 | 92.1 |