ResearchDatasetsAverage of 10 tasksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Language Model EvaluationAverage of 10 tasks45.02Overall Performance12