ResearchBenchmarksMulti-Agent Reinforcement Learning on MA-MuJoCo Ant (4x2) medium-replayFollow2,024.66Average Episode ReturnSim2O924.03841,209.77671,495.5151,781.2533Jun 19, 2026Evaluation ResultsMethodMethodLinksAverage Episode ReturnSim2OSteps=1 millionSteps=1 million2026.062,024.66PEX-MASteps=1 millionSteps=1 million2026.061,744.76AWAC-MASteps=1 millionSteps=1 million2026.061,614.57RLPD-MASteps=1 millionSteps=1 million2026.061,200.57PROTO-MASteps=1 millionSteps=1 million2026.06966.37