Simultaneous Optimization on HybridCoop+AllD Flagship setting (full-cooperation reference 2.25)
2.24Per-interaction PayoffReciprocity gradient
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Reciprocity gradientOpponent access=oracle, Experimental setting ID=Setting (A.3), Gradient path=analytic gradient through opponents2026.05 | 2.24 | 99 | 4 | |
| Reciprocity gradientOpponent access=learned opponent models, Experimental setting ID=Setting (B.3), Gradient path=analytic gradient through opponents2026.05 | 2.225 | 99 | 20 | |
| DPGGradient path=sampled critic, Analytic path=none2026.05 | 1.81 | 80 | 0 | |
| DDPGGradient path=sampled critic, Analytic path=none2026.05 | 1.55 | 69 | 0 | |
| TD3Gradient path=sampled critic, Analytic path=none2026.05 | 1.54 | 69 | 0 |