Multi-Agent Coordination on XOR game Generalization (Train n=2, k=3; Eval n=3, k=3)
0Success Rate (Greedy Policy)MAPPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MAPPO2026.05 | 0 | 22 | |
| QMIX2026.05 | 0 | 22 | |
| IPPO2026.05 | 0 | 22 | |
| MASAC2026.05 | 0 | 22 | |
| pH-MARL2026.05 | 0 | 22 | |
| GSA2026.05 | 0 | 22 | |
| MAT2026.05 | 0 | 44 | |
| Diamond Attentionstructured random masking=enabled2026.05 | 0 | 0 | |
| Diamond Attention (w/o mask)structured random masking=disabled2026.05 | 0 | 22 | |
| Diamond Attention (dropout)dropout=enabled2026.05 | 0 | 22 |