Code Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
81.71Accuracy
17
Jul 8, 2026
30.1HumanEval Score
17
Apr 14, 2026
301.43TPS
17
Apr 9, 2026
56.3Pass@1
17
Jun 9, 2026
75.2Rate @32 Score
17
Apr 16, 2026
32.4% Avg@4
17
Feb 26, 2026
77.5Avg@4 (%)
17
Feb 26, 2026
55.7NCB (zh) Python Score
17
Feb 26, 2026
57.6Accuracy
17
Feb 26, 2026
0.831Accuracy (Easy)
17
Feb 26, 2026
54.6C++ Pass Rate
17
Feb 26, 2026
36Pass@5
17
Feb 26, 2026
66.1pass@5
17
Feb 26, 2026
65.7Response Accuracy
16
Jun 17, 2026
84.26Performance (%)
16
Jun 11, 2026
0.61LCB Score
16
Jun 11, 2026
2.975Acceptance Length (τ)
16
Jun 11, 2026
2.032Acceptance Length (τ)
16
Jun 11, 2026
48.51Accuracy
16
Jun 11, 2026
88.9Accuracy
16
Jun 4, 2026
44.8Accuracy
16
Jun 2, 2026
74.8Pass@4
16
May 27, 2026
79.37Performance (%)
16
May 26, 2026
66.41Throughput
16
May 22, 2026
3.53Success Rate (SR)
16
May 20, 2026