ResearchBenchmarksMulti-Agent Reinforcement Learning on MA-MuJoCo Ant (8x1) medium-replayFollow1,546.51Average Episode ReturnSim2O1,209.7061,297.14551,384.5851,472.0245Jun 19, 2026Evaluation ResultsMethodMethodLinksAverage Episode ReturnSim2OSteps=1 millionSteps=1 million2026.061,546.51AWAC-MASteps=1 millionSteps=1 million2026.061,451.45PEX-MASteps=1 millionSteps=1 million2026.061,434.28RLPD-MASteps=1 millionSteps=1 million2026.061,373.63PROTO-MASteps=1 millionSteps=1 million2026.061,222.66