Language Modeling Evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
69.95AE Score
27
May 19, 2026
72.98MMLU Accuracy
17
Mar 4, 2026
60.35Accuracy
16
Apr 21, 2026
70.22ARC
14
Feb 26, 2026
6.63Grammar
5
Apr 3, 2026
49,781.23Throughput (Tokens/s)
5
Mar 4, 2026
58.5Overall Average Score
5
Feb 26, 2026
34.64ARC Accuracy
4
Feb 26, 2026