ResearchDatasetsStandard NLP Evaluation SuiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsNatural Language UnderstandingStandard NLP Evaluation Suite (BoolQ, HellaSwag, WinoGrande, ARC, OBQA, RACE)0.605BoolQ Accuracy2
Natural Language UnderstandingStandard NLP Evaluation Suite (BoolQ, HellaSwag, WinoGrande, ARC, OBQA, RACE)0.605BoolQ Accuracy2