ResearchTasksGeneral Model EvaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedIFEval, MultiIF, MMLU, MMLU-Pro, GPQA-Diamond, HumanEval, MBPP, GSM8K, MATH-500, TheoremQA, CMMLU, CEvalCHORD69.3Average Score20Jun 19, 2026Aggregate HumanEval, MBPP, GSM8K, Minerva Math, MMLU, ARC, HellaSwag, PIQA, WinoGrandeNemotron-Labs-Diffusion-8B72.36Average Accuracy9Jul 8, 2026
IFEval, MultiIF, MMLU, MMLU-Pro, GPQA-Diamond, HumanEval, MBPP, GSM8K, MATH-500, TheoremQA, CMMLU, CEvalCHORD69.3Average Score20Jun 19, 2026
Aggregate HumanEval, MBPP, GSM8K, Minerva Math, MMLU, ARC, HellaSwag, PIQA, WinoGrandeNemotron-Labs-Diffusion-8B72.36Average Accuracy9Jul 8, 2026