ResearchDatasets10 tasksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model Evaluation10 tasks average70.56Avg Accuracy50