ResearchDatasetsArxivRollBenchFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLanguage Model EvaluationArxivRollBench 2026a70.8Valid Accuracy42Research Paper Reasoning and ComprehensionArxivRollBench 2025a (val)44.3Valid Accuracy38Biased overtraining evaluationArxivRollBench0.22RSII14Contamination EvaluationArxivRollBench0.48Absolute RS_I14