ResearchBenchmarksCooperative Multi-Agent Reinforcement Learning on Adversary (last 2% of train)Follow85.04Mean Episodic RewardSACHI7.466427.605747.74567.8843May 8, 2026Evaluation ResultsMethodMethodLinksMean Episodic RewardSACHIL=2, d=64, K=1L=2, d=64, K=12026.0585.04DGN2026.0583.54CASEC2026.0581.55QTRAN2026.0579.79QPLEX2026.0565.69FOP2026.0544.68DCG2026.0540.35DICG2026.0536.51IQL2026.0533.46MAPPO2026.0531.83IPPO2026.0523.54VDN2026.0518.69QMIX2026.0510.45