ResearchDatasetsdiverse natural language user queriesFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsFoundation Model Selection100 diverse natural language user queries (test)75.76Average Top-14