ResearchBenchmarksMulti-agent reinforcement learning on HalfCheetah 3x2Follow5,345Mean Episode RewardHPA1,765.322,694.663,6244,553.34May 8, 2026Evaluation ResultsMethodMethodLinksMean Episode RewardMax Episode RewardHPA2026.055,3455,674HAPPO2026.055,1005,419STEP2026.053,8983,902HATRPO2026.052,7273,800MAPPO2026.051,9032,654