Multi-agent reinforcement learning on SMAC v2 (5v5 and 5v6 Matchups)
89Protoss 5v5 Win RateMARL-GPT
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MARL-GPTTraining Scope=Multi-Env, Memory Architecture=Memory-based, Number of Parameters=7M, History Window Size=62026.04 | 89 | 54 | 93 | 63 | 74 | 46 | |
| ExpertTask Specificity=Single-task expert2026.04 | 87 | 49 | 91 | 61 | 72 | 48 | |
| BC-LSTMTraining Scope=Single-Env, Memory Architecture=Memory-based2026.04 | 85 | 30 | 88 | 51 | 72 | 38 | |
| DTTraining Scope=Single-Env, Memory Architecture=Memory-based2026.04 | 82 | 30 | 84 | 48 | 65 | 34 | |
| RATETraining Scope=Single-Env, Memory Architecture=Memory-based2026.04 | 79 | 28 | 85 | 41 | 64 | 33 | |
| BCTraining Scope=Single-Env, Memory Architecture=Memory-free2026.04 | 61 | 12 | 69 | 24 | 56 | 24 | |
| CQLTraining Scope=Single-Env, Memory Architecture=Memory-free2026.04 | 57 | 14 | 69 | 28 | 50 | 23 |