ResearchDatasetsWizardMath, Tulu, and WizardLM evaluation suitesFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-ability model mergingWizardMath (Math), Tulu-2 (Science), and WizardLM (Code) evaluation suites (test)68.4Math Accuracy7
Multi-ability model mergingWizardMath (Math), Tulu-2 (Science), and WizardLM (Code) evaluation suites (test)68.4Math Accuracy7