ResearchDatasetsDownstream Tasks AverageFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsZero-shot evaluationDownstream Tasks Average (SciQ, ARC-E, ARC-C, LogiQA, OBQA, BoolQ, HellaSwag, PIQA, WinoGrande) zero-shot lm-evaluation-harness49Average Accuracy12
Zero-shot evaluationDownstream Tasks Average (SciQ, ARC-E, ARC-C, LogiQA, OBQA, BoolQ, HellaSwag, PIQA, WinoGrande) zero-shot lm-evaluation-harness49Average Accuracy12