ResearchDatasetsComprehensive Evaluation SuiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Language Model EvaluationComprehensive Evaluation Suite50.7Overall Average Score14