ResearchDatasetsMMLU, GSM8K, HumanEval, BBHFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Language Model CapabilityMMLU, GSM8K, HumanEval, BBH Combined68.42Average Score8