ResearchDatasetsUtility SetFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsGeneral Language Model EvaluationUtility Set MMLU, BBH, TruthfulQA, TriviaQA, AlpacaEval68.93MMLU34