WikiText-103
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
WikiText-103 In Domain (test)
0.67GPT-4 Preference Ratio (Better)
4
WikiText-103
6.59GFLOPs/token
4
WikiText-103 Llama-3.1-8B activations v1 (test)
0.057MSE
3
WikiText-103 GPT-2-small activations v1 (test)
2.04MSE
3
WikiText-103 (test)
94Exact Match
3
WikiText-103 relational questions (test)
86.9Accuracy (Country_Curr)
3
Wikitext-103
28.37Perplexity (PPL)
3
WikiText-103
92.1Accuracy
3
WikiText-103 Without Adaptive Inputs
26.44PPL (0 Context)
3
WikiText-103 Adaptive Inputs
20.72PPL (0 Context)
3
Wikitext-103 BB BPE Dictionary (val)
11.58PPL (Validation)
3
WikiText-103 char
3.856Perplexity
2
WikiText-103
91MAUVE Score
2
WikiText-103
13.92Perplexity
2
WikiText-103 (test)
90.1Coverage
2
WikiText-103
0.97Descent Rate (r)
1
Salesforce/wikitext-103 Semi-OOD (val)
47.76Reconstruction Accuracy (TRA)
1