ResearchDatasetsARC, TruthfulQA, Winogrande, GSM8K, HellaSwag, MMLUFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model EvaluationARC, TruthfulQA, Winogrande, GSM8K, HellaSwag, MMLU73.7ARC Accuracy16