ResearchDatasetsMMLU, ARC-c, HellaSwag, BOOLQ, PIQA, WinoGrandeFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsNatural Language Understanding and ReasoningMMLU, ARC-c, HellaSwag, BOOLQ, PIQA, WinoGrande zero-shot69.72Average Score (Zero-shot)20
Natural Language Understanding and ReasoningMMLU, ARC-c, HellaSwag, BOOLQ, PIQA, WinoGrande zero-shot69.72Average Score (Zero-shot)20