ResearchDatasetsCore CapabilitiesFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Large Language Model EvaluationCore Capabilities Aggregate72.32Average Score20