ResearchDatasetsREF-qFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-Agent Reinforcement LearningREF-q rac-dist (test)125Mean Episodic Reward (q=2)12