ResearchDatasetsOpenLLM LeaderboardFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsDownstream Task EvaluationOpenLLM Leaderboard v1 (test)63.95MMLU (5-shot)14General Language Understanding and ReasoningOpenLLM Leaderboard BBH, GPQA, IFEVAL, MMLU, MUSR (test)72.7BBH4
General Language Understanding and ReasoningOpenLLM Leaderboard BBH, GPQA, IFEVAL, MMLU, MUSR (test)72.7BBH4