Multi-agent Reinforcement Learning on VMAS
157Dispersion ScoreMAPPO-CERMIC
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| MAPPO-CERMIC2025.09 | 157 | 144 | 25.4 | 172 | 64 | 67.3 | 3.94 | -1.47 | 106 | — | |
| QPLEX-ICES2025.09 | 156 | 136 | 25.5 | 164 | 61 | 63.2 | 3.96 | -1.44 | 63 | — | |
| QMIX-SPECTRA2025.09 | 152 | 114 | 24.2 | 154 | 47 | 52.9 | 3.82 | -2.84 | 2 | — | |
| MAPPOexploration=epsilon greedy2025.09 | 151 | 122 | 22.8 | 161 | 27 | 63.3 | 3.74 | -3.53 | -12 | — | |
| MACE2025.09 | 148 | 122 | 28.1 | 166 | 60 | 60 | 3.62 | -1.62 | 24 | — | |
| CPM2025.09 | 146 | 125 | 25.7 | 162 | 44 | 61 | 3.73 | -2.51 | 20 | — | |
| MAPPO2025.09 | 144 | 108 | 21.8 | 159 | 23 | 60.3 | 3.71 | -3.7 | -37 | — | |
| MAPPO-DB2025.09 | 134 | 88 | 23 | 155 | 51 | 55.2 | 3.82 | -2.05 | -4 | — | |
| QMIX-CERMIC2025.09 | 102 | 92 | 27.2 | 163 | 84 | 62.7 | 3.77 | -1.31 | 78 | — | |
| QMIX2025.09 | 69 | 65 | 25.4 | 154 | 42 | 48.5 | 3.4 | -2.83 | 55 | — | |
| CoHetselfEnvironment Steps=2×10^52024.08 | — | — | — | — | — | — | — | — | — | 0.28 | |
| CoHetteamEnvironment Steps=2×10^52024.08 | — | — | — | — | — | — | — | — | — | 0.41 | |
| HetGPPOEnvironment Steps=2×10^52024.08 | — | — | — | — | — | — | — | — | — | -0.49 | |
| IPPOEnvironment Steps=2×10^52024.08 | — | — | — | — | — | — | — | — | — | -0.73 |