ResearchBenchmarksCooperative Multi-Agent Reinforcement Learning on Speaker-Listener (last 2% of train)Follow-17.22Mean Episodic RewardSACHI-49.3872-41.0361-32.685-24.3339May 8, 2026Evaluation ResultsMethodMethodLinksMean Episodic RewardSACHIL=2, d=64, K=1L=2, d=64, K=12026.05-17.22DGN2026.05-17.82QMIX2026.05-18.45MAPPO2026.05-19.44IPPO2026.05-20.38DCG2026.05-21.19DICG2026.05-22.45VDN2026.05-25.68IQL2026.05-27.7QPLEX2026.05-29.49QTRAN2026.05-34.29CASEC2026.05-43.79FOP2026.05-48.15