ResearchDatasetsAggregated benchmark suiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Language Model EvaluationAggregated 11-benchmark suite Math, Code, IF74.9Average Accuracy21