ResearchDatasetsfLLMFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsBandit OptimizationfLLM35.6Cumulative Regret8