Software Engineering Problem Solving on SWE-Bench C#
47.3Resolve RateNo Subagent
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| No SubagentMain Agent=Claude Sonnet 4.52026.05 | 47.3 | — | |
| SFT-4BMain Agent=Claude Opus 4.62026.05 | 47 | 95.3 | |
| No SubagentMain Agent=Claude Opus 4.62026.05 | 46.7 | — | |
| Terminus-4BMain Agent=Claude Opus 4.62026.05 | 46.7 | 89.3 | |
| OpusMain Agent=Claude Sonnet 4.52026.05 | 46.7 | 75.3 | |
| Terminus-4BMain Agent=Claude Sonnet 4.52026.05 | 46.7 | 74.7 | |
| OpusMain Agent=Claude Opus 4.62026.05 | 46 | 94.6 | |
| SonnetMain Agent=Claude Opus 4.62026.05 | 46 | 93.3 | |
| SonnetMain Agent=Claude Sonnet 4.52026.05 | 44.7 | 72 | |
| Vanilla-4BMain Agent=Claude Opus 4.62026.05 | 44 | 91 | |
| Vanilla-4BMain Agent=Claude Sonnet 4.52026.05 | 44 | 74.3 | |
| SFT-4BMain Agent=Claude Sonnet 4.52026.05 | 44 | 73.2 | |
| SFT-4BMain Agent=GPT-5.3-Codex2026.05 | 42 | 89.9 | |
| SonnetMain Agent=GPT-5.3-Codex2026.05 | 40.7 | 90.7 | |
| OpusMain Agent=GPT-5.3-Codex2026.05 | 40.3 | 89.3 | |
| No SubagentMain Agent=GPT-5.3-Codex2026.05 | 38 | — | |
| Terminus-4BMain Agent=GPT-5.3-Codex2026.05 | 38 | 85.3 | |
| Vanilla-4BMain Agent=GPT-5.3-Codex2026.05 | 36.9 | 87.1 |