WikiText-2
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
WikiText-2
1.08Perplexity (PPL)
2,862
WikiText-2
3.84Perplexity
205
WikiText-2 (val)
4.73Perplexity (BVS)
179
Wikitext-2
5.47Perplexity (PPL)
146
WikiText-2
4.88Perplexity
138
WikiText-2
2.81Perplexity
113
WikiText-2
0.811COH Score
112
WikiText-2 prompt 2048-token (train)
0.003Softmax KL Divergence
99
WikiText-2
4.41WikiText-2 Score
86
WikiText-2
93.039Average Kurtosis
72
WikiText-2
3.52PPL
64
WikiText-2 raw (test)
5.674Perplexity
63
WikiText-2
5.82Perplexity (PPL)
40
WikiText-2
0.9Mauve
33
WikiText-2
100Cosine Similarity
32
WikiText-2 context length 2048 (val)
9.92WikiText-2 PPL
24
WikiText-2 Llama-3.1-8B-Instruct (test)
7.2Perplexity
22
WikiText-2 v1 (val)
42.41Perplexity
20
WikiText-2
4.91Perplexity (PPL)
19
WikiText-2 10K-word evaluator standardized
11.9PPL Delta (%)
18
WikiText-2 (val)
20PPL (10% sparsity)
17
Wikitext-2 v1 (test)
7.33Perplexity (PPL)
17
Wikitext 2 Llama 2 & 3 (test)
5.47PPL (Llama 2, Config 7)
16
WikiText-2 (test)
3.319Perplexity
16
WikiText-2
39.1ROUGE-1
15