ResearchTasksGeneral Language Model CapabilityFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedMMLU, GSM8K, HumanEval, BBH CombinedVAR68.42Average Score8Mar 24, 2026