ResearchBenchmarksMulti-Agent Reinforcement Learning on MA-MuJoCo Hopper (3x1) medium-replayFollow1,354.49Average Episode ReturnSim2O617.5668808.88341,000.21,191.5166Jun 19, 2026Evaluation ResultsMethodMethodLinksAverage Episode ReturnSim2OSteps=1 millionSteps=1 million2026.061,354.49PEX-MASteps=1 millionSteps=1 million2026.061,236.39AWAC-MASteps=1 millionSteps=1 million2026.06908.89RLPD-MASteps=1 millionSteps=1 million2026.06903.51PROTO-MASteps=1 millionSteps=1 million2026.06645.91