Agentic Coding on SWE-Bench Pro (public)
69.1Solve RateClaude Opus 4.7
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Claude Opus 4.7Harness=Claude Code, Thinking Level=xHigh2026.06 | 69.1 | 2.28 | |
| GPT-5.4Harness=Codex, Thinking Level=Medium2026.06 | 62.1 | 1.41 | |
| Gemini 3.1 ProHarness=OpenCode, Thinking Level=High2026.06 | 54.4 | 0.97 | |
| Qwen3.5-397B-A17BHarness=MSA, Thinking=enabled2026.06 | 45.8 | — |