ResearchDatasetsARC-E, ARC-C, BoolQ, OBQA, HellaSwag, TruthfulQA, MMLUFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsCommonsense Reasoning and Language ModelingARC-E, ARC-C, BoolQ, OBQA, HellaSwag, TruthfulQA, MMLU (test)92.4ARC-E Accuracy14
Commonsense Reasoning and Language ModelingARC-E, ARC-C, BoolQ, OBQA, HellaSwag, TruthfulQA, MMLU (test)92.4ARC-E Accuracy14