AlpacaEval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
AlpacaEval random subset of 100 samples
99.69Avg Token-level Precision/Recall
12
AlpacaEval
78.3Coverage
12
AlpacaEval Length-Controlled (test)
8.78LC Win Rate
12
AlpacaEval MIX-14K gpt4_turbo (test)
17.269LC Win Rate
12
AlpacaEval trained on UF-G
17.314LC Win Rate
12
AlpacaEval
95.58AlpacaEval AQA Score
12
AlpacaEval (test)
62BWR
12
AlpacaEval (main)
153Expected Survival Time (EST)
12
AlpacaEval
52Win Rate
12
AlpacaEval Helpsteer2 2 (test)
29.64LC Win Rate
12
AlpacaEval UltraFeedback 2 (test)
53.37LC Win Rate
12
X-AlpacaEval
70.9Chinese Win Rate
12
AlpacaEval
0.44Rank Correlation (RK)
11
AlpacaEval (805 prompts)
7.22OLMo-2 Reward Score
10
AlpacaEval
0False Positive Rate
10
AlpacaEval Audio
4.59EN Score
10
AlpacaEval against gpt4-1106-preview (test)
31.3Win Rate (Raw)
10
AlpacaEval 2.0 (test)
54.17LC% over π0
10
AlpacaEval 203 random samples 2
19.13LC Win Rate
10
AlpacaEval2 short-context
22.9AlpacaEval2 Score
10
AlpacaEval gpt-4-turbo judge v2 (test)
47.89Win Rate (LC)
9
AlpacaEval gpt-4o-mini judge v2 (test)
60LC Win Rate (%)
9
AlpacaEval
0False Alarm Rate (FAR)
9
AlpacaEval
85.86Accuracy
9
AlpacaEval LC 2.0
78.61AlpacaEval 2.0 LC Score
9