ResearchDatasetsMMLU, GSM8K, GPQA, HumanEval, TruthfulQA, IFEvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model EvaluationMMLU, GSM8K, GPQA, HUMANEVAL, TRUTHFULQA, IFEVAL70.7MMLU23General Language CapabilitiesMMLU, GSM8K, GPQA, HumanEval, TruthfulQA, IFEval Aggregate71.2Average Score10
General Language CapabilitiesMMLU, GSM8K, GPQA, HumanEval, TruthfulQA, IFEval Aggregate71.2Average Score10