HumanEval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
HumanEval
1.91Throughput
2
HumanEval 19 models (test)
80.9Pairwise Resolution
2
HumanEval
49.4Accuracy
2
HumanEval Offline (test)
90.9pass@1
2
HumanEval Online Collection
82.4pass@1
2
HumanEval+
80.49Pass@k
2
HumanEval
34.76Pass@1 Accuracy
2
HumanEval+
41.6Avg Score (k=10)
2
HumanEval
89Accuracy
2
HumanEval
81.8NFE
2
HumanEval-G
82.32Pass Rate Before
2
HumanEval
206.79Output Throughput
2
HumanEval
51.22Final Accuracy
2
HumanEval
93Functional Score (%)
2
HumanEval
0.2Inference Cost (USD)
2
HumanEval
0.017MAE
2
HumanEval dLLM-Var
31.7Pass@1
2
humaneval inst
66Accuracy
2
HumanEval-EvalPlus Standard (test)
89.6pass@1
2
HumanEval MultiPL-E translation Rust (test)
0.68Pass@1
2
HumanEval Binary Search
50Completion Rate
1
HumanEval Fibonacci
55Completion Rate (CR)
1
HumanEval-Hard (100-item)
75.7Baseline Score
1
HumanEval
—Primary metric
0
HumanEval
—Primary metric
0