ResearchBenchmarksZero-Sum Multi-Agent Reinforcement Learning on MPE simple_adversaryFollow91.17RewardMAPPO-7.047618.451243.9569.4488Jun 9, 2026Evaluation ResultsMethodMethodLinksRewardCumulative RegretRegret GapMAPPO2026.0691.175,470.55,926.82MADDPG2026.064.911,316.86187.11Φ-AC2026.06-3.27281.343.32