ResearchBenchmarksMulti-Agent Reinforcement Learning on MA-MuJoCo Ant (4x2) mediumFollow1,586.6Episode ReturnSim2O1,413.961,458.781,503.61,548.42Jun 19, 2026Evaluation ResultsMethodMethodLinksEpisode ReturnSim2OSteps=1 millionSteps=1 million2026.061,586.6PEX-MASteps=1 millionSteps=1 million2026.061,510.89AWAC-MASteps=1 millionSteps=1 million2026.061,484.84RLPD-MASteps=1 millionSteps=1 million2026.061,429.42PROTO-MASteps=1 millionSteps=1 million2026.061,420.6