ResearchDatasetsGSM8K, ARC-C, MedQA, BoolQ, and CoLAFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-task Language EvaluationGSM8K, ARC-C, MedQA, BoolQ, and CoLA Evaluation Average79.87Average Accuracy14
Multi-task Language EvaluationGSM8K, ARC-C, MedQA, BoolQ, and CoLA Evaluation Average79.87Average Accuracy14