ResearchTasksLanguage Modeling and Question AnsweringFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedShort-context task suite (WikiText, LAMBADA, TriviaQA, PIQA, HellaSwag, WinoGrande, ARC-Easy, GPQA, Social IQA, OpenBookQA, SciQ) (test)RoPE++EC14.4WikiText PPL18Feb 26, 2026Standard Benchmarks (ARC-E, ARC-C, BoolQ, HellaSwag, OBQA, PIQA, WinoGrande, MMLU, SciQ) (test)WeSaR-GlobalGC49.75ARC-E Acc (Norm)8Feb 26, 2026
Short-context task suite (WikiText, LAMBADA, TriviaQA, PIQA, HellaSwag, WinoGrande, ARC-Easy, GPQA, Social IQA, OpenBookQA, SciQ) (test)RoPE++EC14.4WikiText PPL18Feb 26, 2026
Standard Benchmarks (ARC-E, ARC-C, BoolQ, HellaSwag, OBQA, PIQA, WinoGrande, MMLU, SciQ) (test)WeSaR-GlobalGC49.75ARC-E Acc (Norm)8Feb 26, 2026