ResearchDatasetsARC, HellaSwag, LAMBADA, PIQAFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsZero-shot Language UnderstandingARC-Easy, ARC-Challenge, HellaSwag, LAMBADA, PIQA lm-eval 0.4.11 (test)81.5Average Accuracy42
Zero-shot Language UnderstandingARC-Easy, ARC-Challenge, HellaSwag, LAMBADA, PIQA lm-eval 0.4.11 (test)81.5Average Accuracy42