ResearchDatasetsGMPFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-agent Reinforcement LearningGMP(omega=0.5)0.001Avg KL Divergence5