ResearchDatasetsAdaptEvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLanguage ModelingAdaptEval (test)1.66NLL32Language Model EvaluationAdaptEval0.273ROUGE-Lsum14