Multi-task Language Evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
42.22Average Score
20
Jul 3, 2026
79.87Average Accuracy
14
Jul 1, 2026
4.35Average Rank
7
Feb 26, 2026
37.78ARC-C (es)
6
Apr 23, 2026
41.2Accuracy
4
Apr 13, 2026
83Instruction Following (SEA-IFEval)
3
Feb 26, 2026