ResearchDatasetsnine-benchmark suiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsZero-shot Language Understanding and Reasoningnine-benchmark suite (MMLU, ARC, CSQA, HellaSwag, OpenBookQA, PIQA, SocialIQA, WinoGrande) (test val)31.7MMLU Accuracy6
Zero-shot Language Understanding and Reasoningnine-benchmark suite (MMLU, ARC, CSQA, HellaSwag, OpenBookQA, PIQA, SocialIQA, WinoGrande) (test val)31.7MMLU Accuracy6