ResearchTasksLarge Language Model ReasoningFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast Updated3 LLM Tasks (CMMLU, GSM8K, HumanEval) (test)Fine-tuned40.4Average Accuracy7Feb 26, 2026