ResearchDatasetsGSM8K, TruthfulQA, CommonsenseQA, MMLU, ARC, and TriviaQAFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model EvaluationGSM8K, TruthfulQA, CommonsenseQA, MMLU, ARC, and TriviaQA (various)88Accuracy9
Large Language Model EvaluationGSM8K, TruthfulQA, CommonsenseQA, MMLU, ARC, and TriviaQA (various)88Accuracy9