HumanEval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
HumanEval
57.3Pass@1
9
HumanEval
59.15Pass@2
9
HumanEval
89Accuracy
9
HumanEval
34.2Accuracy
9
HumanEval pass@1
67.07Pass@1
9
HumanEval+
0.44FDR
9
HumanEval
90Accuracy
9
HumanEval
4.09TPF
9
HumanEval
88.43Avg Accuracy @16
9
HUMANEVAL
48.2Acc
9
HumanEval
85.9F1 Score
9
HumanEvalFix
48.6Python Fix Rate
9
HumanEval
2.74Speedup
8
HumanEval-Pro Held-out after Compositional Stream
72.5Accuracy
8
HumanEval
5.44Latency (ms/tok)
8
HumanEval
1True WS Score
8
HumanEval In-Domain
53.05Accuracy
8
HumanEval Llama-3-70B (test)
26.3QD-Score
8
HumanEval
19.15Pass@1
8
HumanEval-G
100Message Accuracy (MsgAcc)
8
HumanEval
80.9ACC*
8
HumanEval
55.5Accuracy
8
HumanEval
62Pass@1
8
HumanEval
56.7Pass@1
8
HumanEval
14.36Throughput
8