Multi-Agent Reinforcement Learning on REF-q rac-dist (test)
125Mean Episodic Reward (q=2)QMIX
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| QMIXTraining Reward=Individual, Evaluation Setting=rac-dist2022.10 | 125 | 380 | 577 | 5.97 | |
| GRE-MARLTraining Reward=Individual, Evaluation Setting=rac-dist2022.10 | 116 | 244 | 231 | 8.171 | |
| DRE-MARLAggregation Scheme=l_MO + g_MO, Training Reward=Individual, Evaluation Setting=rac-dist2022.10 | 113 | 310 | 454 | 9.36 | |
| DRE-MARLAggregation Scheme=l_SMO + g_MO, Training Reward=Individual, Evaluation Setting=rac-dist2022.10 | 82 | 258 | 278 | 8.467 | |
| DRE-MARLAggregation Scheme=l_SMO, Training Reward=Individual, Evaluation Setting=rac-dist2022.10 | 44 | 171 | 300 | 7.737 | |
| p2p-MARLTraining Reward=Individual, Evaluation Setting=rac-dist2022.10 | 35 | 192 | 227 | 7.517 | |
| DRE-MARLAggregation Scheme=l_ss + g_ss, Training Reward=Individual, Evaluation Setting=rac-dist2022.10 | 23 | -13 | 402 | 7.893 | |
| DRE-MARLAggregation Scheme=l_SMO + g_ss, Training Reward=Individual, Evaluation Setting=rac-dist2022.10 | 11 | 177 | 74 | 7.904 | |
| MAACTraining Reward=Individual, Evaluation Setting=rac-dist2022.10 | 11 | 26 | 31 | 7.324 | |
| MAPPOTraining Reward=Individual, Evaluation Setting=rac-dist2022.10 | -50 | -103 | -61 | 2.457 | |
| IQLTraining Reward=Individual, Evaluation Setting=rac-dist2022.10 | -62 | -210 | -271 | 1.204 | |
| MADDPGTraining Reward=Individual, Evaluation Setting=rac-dist2022.10 | -108 | -371 | -609 | 4.608 |