ResearchTasksLanguage Model Reasoning and Knowledge EvaluationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast Updated10 LLM Benchmarks suite (AIME25, AIME26, CEval, GPQA-D, HLE, IMO-AB, MMLU, MMLU-Pro, MMLU-Rd, MultiCh)ZPPO70AIME 25 Score20Jun 17, 2026
10 LLM Benchmarks suite (AIME25, AIME26, CEval, GPQA-D, HLE, IMO-AB, MMLU, MMLU-Pro, MMLU-Rd, MultiCh)ZPPO70AIME 25 Score20Jun 17, 2026