Multi-agent Reinforcement Learning on MeltingPot
8.43StaHunQMIX-CERMIC
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| QMIX-CERMIC2025.09 | 8.43 | 76.2 | 8.47 | 5.02 | — | — | — | — | — | |
| QPLEX-ICES2025.09 | 7.2 | 76.7 | 9.07 | 5.42 | — | — | — | — | — | |
| MAPPO-CERMIC2025.09 | 7.11 | 78.3 | 10.03 | 6.74 | — | — | — | — | — | |
| MACE2025.09 | 6.18 | 75.2 | 8.94 | 5.52 | — | — | — | — | — | |
| QMIX-SPECTRA2025.09 | 5.75 | 70.4 | 8.51 | 5.17 | — | — | — | — | — | |
| MAPPOexploration=epsilon greedy2025.09 | 5.33 | 74.5 | 8.62 | 5.17 | — | — | — | — | — | |
| QMIX2025.09 | 5.11 | 71.2 | 6.83 | 4.57 | — | — | — | — | — | |
| CPM2025.09 | 5.11 | 74.4 | 8.35 | 5.21 | — | — | — | — | — | |
| MAPPO-DB2025.09 | 5.08 | 71.2 | 8.47 | 4.99 | — | — | — | — | — | |
| MAPPO2025.09 | 5.02 | 74.2 | 8.44 | 4.93 | — | — | — | — | — | |
| COMA2026.05 | — | — | — | — | 0 | 0 | 0 | 0 | — | |
| HAPPO2026.05 | — | — | — | — | 93.6 | 82.7 | 81.1 | 85.8 | — | |
| HPML-MAPPOType=Graph2026.05 | — | — | — | — | 100 | 100 | 100 | 100 | 0.074 | |
| HPML-MAPPOType=Neural2026.05 | — | — | — | — | 88.7 | 99.9 | 98.7 | 95.8 | 411.326 | |
| IA2C2026.05 | — | — | — | — | 83.7 | 88.3 | 70.6 | 80.9 | — | |
| IPPO2026.05 | — | — | — | — | 100 | 30.7 | 84.4 | 71.7 | — | |
| MAPPO2026.05 | — | — | — | — | 86.3 | 96.9 | 86.2 | 89.8 | — |