ResearchDatasetsComposite NLP BenchmarksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsNatural Language UnderstandingComposite NLP Benchmarks BoolQ, RTE, HellaSwag, WinoGrande, ARC-E, ARC-C, OBQA73.5BoolQ Accuracy5
Natural Language UnderstandingComposite NLP Benchmarks BoolQ, RTE, HellaSwag, WinoGrande, ARC-E, ARC-C, OBQA73.5BoolQ Accuracy5