ResearchDatasetsHumanEval, MATH, MMLUFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsAggregate Language and Logic TasksHumanEval++, MATH, MMLU-Redux94.61Average Accuracy11