ResearchDatasetsNorEvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model EvaluationNorEval (test)0.455Overall Score8