AlpacaEval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
AlpacaEval LC 2
74.11Score
23
AlpacaEval 1.0
7,904Win Rate
23
AlpacaEval
100Precision
20
AlpacaEval (test)
99.95Precision
20
AlpacaEval
74.1PIR
20
AlpacaEval Yoruba
68.9Win Rate (%)
20
AlpacaEval Swahili
83Win Rate
20
AlpacaEval Indonesian
64.2Win Rate
20
AlpacaEval Korean
77.8Win Rate
20
AlpacaEval German
65.2Win Rate
20
AlpacaEval Chinese
70.4Win Rate
20
AlpacaEval GPT-4 (test)
31.3AlpacaEval Win Rate (GPT-4)
18
AlpacaEval 2
54.7Length Constraint (LC)
17
AlpacaEval (test)
0.437Rank Correlation (RK)
16
AlpacaEval
51.06AlpacaE
16
AlpacaEval 2.0
51.32LC Win Rate
16
AlpacaEval 2
48.14Win Rate
16
AlpacaEval LC 2
84.3LC Win Rate
16
AlpacaEval 2.0
26.57LC
14
AlpacaEval v1 (test)
97.7AlpacaEval Score
14
AlpacaEval 805 instructions (test)
79.91Win Rate
14
AlpacaEval Generalist alignment prompts 2.0
0.66Average Rating
13
AlpacaEval ULTRA 2.0 (test)
31.58LC WR (%)
12
AlpacaEval IMDB 2.0 (test)
39.72LC WR
12
AlpacaEval EDU 2.0 (test)
40.9LC WR
12