ResearchDatasetsStandard evaluation suite (LAMBADA, ARC, HellaSwag, PIQA, WinoGrande)FollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsZero-shot Language Modeling and Commonsense ReasoningStandard short-context evaluation suite (LAMBADA, ARC, HellaSwag, PIQA, WinoGrande)57.3LAMBADA PPL Score18
Zero-shot Language Modeling and Commonsense ReasoningStandard short-context evaluation suite (LAMBADA, ARC, HellaSwag, PIQA, WinoGrande)57.3LAMBADA PPL Score18