Code Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
42.8Pass@1
15
May 12, 2026
66.17Pass@1
15
Feb 26, 2026
50.6Pass@1
15
Feb 26, 2026
57.3Pass@1
15
Feb 26, 2026
42.6Pass@1
15
Feb 26, 2026
86.9Accuracy (CC→MBPP)
15
Feb 26, 2026
26.7Accuracy (CC)
15
Feb 26, 2026
7.12Speedup
14
Jun 18, 2026
100Normalized Spearman Distance
14
Jun 17, 2026
46.28Pass@1
14
Jun 16, 2026
19.96Pass@1
14
Jun 4, 2026
9.55Score
14
Jun 4, 2026
98.8Pass@1
14
May 28, 2026
79.2Accuracy
14
May 19, 2026
54.88HumanEval Accuracy (greedy pass@1)
14
Jun 9, 2026
70GF Precision
14
Apr 14, 2026
19.3API Precision
14
Apr 14, 2026
50ASR
14
Apr 2, 2026
84.1Eval+ Score
14
Mar 11, 2026
53.79pass@1
14
Mar 9, 2026
25Lua Pass@1
14
Mar 4, 2026
23.4EM
14
Feb 26, 2026
46.3pass@1
14
Feb 26, 2026
4.04Speedup
14
Feb 26, 2026
4Speedup
14
Feb 26, 2026