Multi-agent Collision Avoidance on 50-map out-of-distribution benchmark
1.083Normalized collisionsIPPO + ARMS
Evaluation Results
| Method | Links | |
|---|---|---|
| IPPO + ARMSAlgorithm=IPPO, Agent Count=8, alpha=0.35, reward sparsity=20, Reward Shaping=ARMS2026.05 | 1.083 | |
| IPPO + PBRSAlgorithm=IPPO, Agent Count=8, alpha=0.35, reward sparsity=20, Reward Shaping=PBRS2026.05 | 1.36 | |
| IPPO (No reward shaping)Algorithm=IPPO, Agent Count=8, alpha=0.35, reward sparsity=20, Reward Shaping=None2026.05 | 1.371 | |
| IPPO + ARMSAlgorithm=IPPO, Agent Count=16, alpha=0.35, reward sparsity=20, Reward Shaping=ARMS2026.05 | 1.955 | |
| IPPO (No reward shaping)Algorithm=IPPO, Agent Count=16, alpha=0.35, reward sparsity=20, Reward Shaping=None2026.05 | 2.875 | |
| IPPO + PBRSAlgorithm=IPPO, Agent Count=16, alpha=0.35, reward sparsity=20, Reward Shaping=PBRS2026.05 | 2.958 | |
| IPPO + ARMSAlgorithm=IPPO, Agent Count=32, alpha=0.35, reward sparsity=20, Reward Shaping=ARMS2026.05 | 4.273 | |
| IPPO + PBRSAlgorithm=IPPO, Agent Count=32, alpha=0.35, reward sparsity=20, Reward Shaping=PBRS2026.05 | 6.619 | |
| IPPO (No reward shaping)Algorithm=IPPO, Agent Count=32, alpha=0.35, reward sparsity=20, Reward Shaping=None2026.05 | 7.77 |