SWE-Bench
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
SWE-Bench OpenHands
59.5Accuracy
4
SWE-bench Lite (test)
62.7Resolve Rate
4
SWE-Bench
59Score
4
SWE-bench Lite (50 tasks)
41Validation Success Count
4
SWE-Bench Verified
81.27File-Level Recall
4
SWE-Bench Lite
84.33File-Level Recall
4
SWE-bench
21.4Productivity
4
SWE-Bench Pro (public)
69.1Solve Rate
4
SWE-bench Lite
6.27Misalignment Rate
4
SWE-bench 14 tasks
84.6Success Rate
4
SWE-bench verified
1.64Succ/Mtok (All)
4
SWE-bench Lite
31.4Overall Resolution Success
4
SWE-bench Verified
72.4Generic Score
4
SWE-bench Multilingual (test)
77.8Resolution Rate (%)
4
SWE Verified OpenHands
69.2Pass@1
4
SWE-bench Verified 500 issues (Protocol A)
73.6Success Rate (SR)
4
SWE-Bench Live Lite
0.224Resolve Rate
4
SWE-Bench AgentLess Repair
30.8Resolved Percentage
4
SWE-bench 500 (test)
72.2Resolution Score
4
SWE-Bench Verified
74.2Accuracy
3
SWE-bench Verified (all 500 problems)
55.4Avg@16
3
SWE-Bench Verified
77.1Score
3
SWE-bench Verified (held-out agent data)
0.949AUC-ROC
3
SWE-Bench Python subset Pro
59Resolution Rate
3
SWE-Bench Sphinx Verified (test)
43.51Accuracy
3