ResearchBenchmarksCooperative Multi-Agent Reinforcement Learning on Reference (last 2% of train)Follow-25.39Mean Episodic RewardSACHI-67.3332-56.4441-45.555-34.6659May 8, 2026Evaluation ResultsMethodMethodLinksMean Episodic RewardSACHIL=2, d=64, K=1, attent...L=2, d=64, K=1, attention=single-head2026.05-25.39DCG2026.05-27.34QMIX2026.05-28.81MAPPO2026.05-34.57IPPO2026.05-34.69DICG2026.05-34.97FOP2026.05-35.38IQL2026.05-36.12VDN2026.05-38.44QTRAN2026.05-39.33DGN2026.05-41.95CASEC2026.05-50.71QPLEX2026.05-65.72