ResearchDatasetsStandard SuiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsNatural Language Understanding and ReasoningStandard Suite Zero-shot (PiQA, ARC-E, ARC-C, HellaSwag, WinoGrande, BoolQ)80.7PiQA Accuracy (Zero-shot)39
Natural Language Understanding and ReasoningStandard Suite Zero-shot (PiQA, ARC-E, ARC-C, HellaSwag, WinoGrande, BoolQ)80.7PiQA Accuracy (Zero-shot)39