ResearchDatasetsLightEvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReasoningLightEval (test)0.745Average Success Rate @815Language ModelingLightEval Benchmark Suite13.77Macro Average8