ResearchDatasetsPostTrainBenchFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-task EvaluationPostTrainBench29.17AIME 25 Score41Autonomous LLM trainingPostTrainBench63.75Score32Comprehensive LLM EvaluationPostTrainBench (test)53.33AIME 202517General Reasoning AveragePostTrainBench44.81Average (%)17