ResearchBenchmarksCooperative Multi-Agent Reinforcement Learning on Disperse (last 2% of train)Follow-0.36Mean Episodic RewardDICG-4.7176-3.5863-2.455-1.3237May 8, 2026Evaluation ResultsMethodMethodLinksMean Episodic RewardDICG2026.05-0.36SACHIL=2, d=64, K=1L=2, d=64, K=12026.05-0.37DGN2026.05-0.39FOP2026.05-1.12DCG2026.05-1.16CASEC2026.05-2IQL2026.05-2.36MAPPO2026.05-2.54QMIX2026.05-2.57VDN2026.05-2.59IPPO2026.05-2.78QPLEX2026.05-2.99QTRAN2026.05-4.55