ResearchBenchmarksMulti-agent Reinforcement Learning on MaMuJoCo OMIGA 3-Hopper (Medium)Follow3,360Average Episode RewardOMSD-112.2064789.23181,690.672,592.1082May 9, 2025Jul 15, 2025Sep 21, 2025Nov 28, 2025Feb 3, 2026Apr 12, 2026Jun 19, 2026Evaluation ResultsMethodMethodLinksAverage Episode RewardOMSD2025.053,360Sim2OSteps=1 millionSteps=1 million2026.062,771.12PEX-MASteps=1 millionSteps=1 million2026.062,337.35PROTO-MASteps=1 millionSteps=1 million2026.061,894.33AWAC-MASteps=1 millionSteps=1 million2026.061,810.82RLPD-MASteps=1 millionSteps=1 million2026.061,464.15OMIGA2025.051,189.26ICQ2025.05501.79CQLMA2025.05401.27BCQMA2025.0544.58OMAR2025.0521.34