ResearchBenchmarksMulti-agent Reinforcement Learning on Walker2d 3x2Follow4,232Mean Episode RewardHPA2,610.643,031.573,452.53,873.43May 8, 2026Evaluation ResultsMethodMethodLinksMean Episode RewardMax Episode RewardHPA2026.054,2324,467HAPPO2026.053,7854,001STEP2026.053,4513,788HATRPO2026.053,1423,285MAPPO2026.052,6733,000