ResearchDatasetsGPQA, HumanEval, LiveCodeBench, AIME, MATHFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Language Model Reasoning and CodingGPQA-Diamond, HumanEval, LiveCodeBench v6, AIME25, and MATH50088.3Throughput (Tokens/User)10
Large Language Model Reasoning and CodingGPQA-Diamond, HumanEval, LiveCodeBench v6, AIME25, and MATH50088.3Throughput (Tokens/User)10