ResearchTasksZero-shot Natural Language UnderstandingFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedStandard Zero-shot NLU Suite (ARC-challenge, ARC-easy, BoolQ, HellaSwag, LAMBADA, PIQA, RACE, SciQ, Record, OBQA)MaxScore21.22ARC Challenge18Feb 26, 2026LM-Evaluation-Harness ARC, BoolQ, HellaSwag, LAMBADA, PIQA, RACE, SciQ, Record, OBQALlama 7B Baseline46.8ARC Challenge13Feb 26, 2026NLU Benchmark Suite CMNLI, HeSW, PIQA, WSC, CoQA, BoolQ, Race-M, Race-H, XSum, C3LaCo*34.43CMNLI Accuracy8Apr 23, 2026T0 (test)T0-3B65.5Accuracy8Feb 26, 2026
Standard Zero-shot NLU Suite (ARC-challenge, ARC-easy, BoolQ, HellaSwag, LAMBADA, PIQA, RACE, SciQ, Record, OBQA)MaxScore21.22ARC Challenge18Feb 26, 2026
LM-Evaluation-Harness ARC, BoolQ, HellaSwag, LAMBADA, PIQA, RACE, SciQ, Record, OBQALlama 7B Baseline46.8ARC Challenge13Feb 26, 2026
NLU Benchmark Suite CMNLI, HeSW, PIQA, WSC, CoQA, BoolQ, Race-M, Race-H, XSum, C3LaCo*34.43CMNLI Accuracy8Apr 23, 2026