ResearchBenchmarksMulti-Agent Reinforcement Learning on MA-MuJoCo Ant (8x1) medium-expertFollow1,847.32Average Episode ReturnSim2O1,443.93521,548.66011,653.3851,758.1099Jun 19, 2026Evaluation ResultsMethodMethodLinksAverage Episode ReturnSim2OSteps=1 millionSteps=1 million2026.061,847.32AWAC-MASteps=1 millionSteps=1 million2026.061,793.74RLPD-MASteps=1 millionSteps=1 million2026.061,774.35PEX-MASteps=1 millionSteps=1 million2026.061,743.99PROTO-MASteps=1 millionSteps=1 million2026.061,459.45