Multi-agent reinforcement learning on Multi-Agent Coin Game
-4.227Coin ReturnD-BOS
Evaluation Results
| Method | Links | |
|---|---|---|
| D-BOSEvaluation against frozen policies=true, k=52026.05 | -4.227 | |
| PPO (No shaping)Evaluation against frozen policies=true, shaping=none2026.05 | -4.96 | |
| D-BOSEvaluation against frozen policies=true, k=12026.05 | -5 | |
| D-BOSEvaluation against frozen policies=true, k=32026.05 | -5.013 | |
| BBMEvaluation against frozen policies=true2026.05 | -5.307 |