Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
23Accuracy (LAMBADA 500)
4
Apr 14, 2026
1.606Loss
4
Apr 13, 2026
1.33Loss
4
Apr 13, 2026
26.8Perplexity
4
Apr 6, 2026
1.336Loss
4
Mar 24, 2026
3.22PPL
4
Jun 23, 2026
57.56Accuracy (%)
4
Mar 13, 2026
2.681BPB (val)
4
Mar 10, 2026
21.43Perplexity
4
Feb 26, 2026
0.46Delta PPL (Llama2-7B)
4
Feb 26, 2026
94.22Accuracy
4
Feb 26, 2026
97.73Accuracy
4
Feb 26, 2026
76.92Accuracy
4
Feb 26, 2026
27.99PPL
4
Feb 26, 2026
1.844Loss
4
Feb 26, 2026
2.955Loss
4
Feb 26, 2026
0.64L_inf
4
Feb 26, 2026
0.33L_inf
4
Feb 26, 2026
0.86L_inf
4
Feb 26, 2026
0.79L_inf
4
Feb 26, 2026
1.61Loss
4
Feb 26, 2026
65.629PPL
4
Feb 26, 2026
6.59GFLOPs/token
4
Feb 26, 2026
8.52PPL
4
Feb 26, 2026
9.78PPL
4
Feb 26, 2026