Multi-agent Reinforcement Learning on MaMuJoCo OMIGA 2-Ant (Medium-Replay)
1,822.72Average Episode RewardSim2O
Evaluation Results
| Method | Links | |
|---|---|---|
| Sim2OSteps=1 million2026.06 | 1,822.72 | |
| PEX-MASteps=1 million2026.06 | 1,759.1 | |
| AWAC-MASteps=1 million2026.06 | 1,499.56 | |
| RLPD-MASteps=1 million2026.06 | 1,358.21 | |
| OMIGA2025.05 | 1,105.13 | |
| ICQ2025.05 | 1,016.68 | |
| OMSD2025.05 | 1,009 | |
| PROTO-MASteps=1 million2026.06 | 970.35 | |
| BCQMA2025.05 | 950.77 | |
| CQLMA2025.05 | 234.62 | |
| OMAR2025.05 | -2,014.2 |