ResearchDatasetsLLM Benchmark SuiteFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLanguage UnderstandingLLM Benchmark Suite (MMLU, ARC-C, PIQA, WinoG, GSM8K, HellaSwag, GPQA, RACE) (test)57.93Overall Accuracy13Language Modeling10 LLM benchmark suite macro-average71.8PASS-AT-1 Accuracy9
Language UnderstandingLLM Benchmark Suite (MMLU, ARC-C, PIQA, WinoG, GSM8K, HellaSwag, GPQA, RACE) (test)57.93Overall Accuracy13