Agentic Coding on DevEval
94.8Solve RateGPT-5.4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5.4Harness=Codex, Thinking Level=Medium2026.06 | 94.8 | 0.2 | |
| Claude Opus 4.7Harness=Claude Code, Thinking Level=xHigh2026.06 | 91.9 | 0.26 | |
| Gemini 3.1 ProHarness=OpenCode, Thinking Level=High2026.06 | 88.8 | 0.52 | |
| Qwen3.5-397B-A17BHarness=MSA, Thinking=enabled2026.06 | 71.4 | — |