Large Language Model Evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
56.5Weighted Average Score
4
Mar 10, 2026
52.8Weighted Average Score
4
Mar 10, 2026
49.7Weighted Average Score
4
Mar 10, 2026
24.72GSM8K
2
Apr 27, 2026
-0.5Mean Quality Delta
1
May 12, 2026
0Mean Quality Delta
1
May 12, 2026