AlpacaEval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
AlpacaEval Length Controlled (test)
27.86AlpLC Score
8
AlpacaEval benign prompts
0False Positive Rate
8
AlpacaEval weighted gpt4 turbo 2.0
46.11Win Rate
8
AlpacaEval
90.1Score
7
AlpacaEval (test)
52.59LC Win Rate
7
AlpacaEval
3.88WER
7
AlpacaEval
72.22Accuracy
7
AlpacaEval 2.0 (test)
11.49Win Rate (LC)
7
AlpacaEval ELOM gpt4 (test)
1,629ELOM
7
AlpacaEval Alp Leaderboard GPT4-1106-Preview baseline
32.44Win Rate (LC)
7
AlpacaEval OOD
0.841HV Score
6
AlpacaEval 2.0
84.3Quality Score
6
AlpacaEval 2.0
92.8Instruct vs. Pretrained Win Rate
6
AlpacaEval 2
4.66Win-rate Delta
6
AlpacaEval Leaderboard Mixtral 8x7B vs Mixtral 8x22B reference (test)
44.28LC Win Rate
6
AlpacaEval Mixtral 8x22B generations 1.0 (test)
32.58Win Rate LC
6
AlpacaEval LC (test)
84.8Win Rate
5
AlpacaEval (OOD)
24.9KL Div (α=1)
5
AlpacaEval out-of-domain 2.0
2.4LC-WR (Win Rate)
4
AlpacaEval length-matched
0.481D_Can Mean
4
AlpacaEval 2.0
168Discrimination
3
AlpacaEval Borderline
98WinRate
3
AlpacaEval Benign (n=50)
97WinRate
3
AlpacaEval
76.1Performance Score
3
AlpacaEval GPT-5.2-judged (test)
64.4Win Rate
3