CodeEval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
CodeEval-Pro BigCodeBench-Lite-Pro and HumanEval-Pro (Held-out)
79.2Average Accuracy
18
CodeEval-Pro BigCodeBench-Lite-Pro and HumanEval-Pro (2nd Pass)
64.6Average Accuracy
18
CodeEval-Pro BigCodeBench-Lite-Pro and HumanEval-Pro (1st Pass)
66.7Average Accuracy
18