ResearchBenchmarksMulti-agent Reinforcement Learning on Walker2d 2x3Follow4,532Mean Episode RewardHPA2,777.523,233.013,688.54,143.99May 8, 2026Evaluation ResultsMethodMethodLinksMean Episode RewardMax Episode RewardHPA2026.054,5325,021HAPPO2026.053,4613,957HATRPO2026.053,0893,090MAPPO2026.052,9713,499STEP2026.052,8453,291