ResearchDatasetsNine-benchmarkFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsDownstream Language Understanding and ReasoningNine-benchmark evaluation suite32.1MMLU Accuracy3