Maze Navigation on Maze MCR variant (100 held-out trajectories)
0.057D_policyPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOReference Policy=Optimal2025.06 | 0.057 | |
| MPPO BReference Policy=Optimal2025.06 | 0.076 | |
| MPPO AReference Policy=Optimal2025.06 | 0.084 | |
| MPPO AReference Policy=Bot A2025.06 | 0.471 | |
| MPPO BReference Policy=Bot B2025.06 | 0.481 | |
| PPOReference Policy=Bot B2025.06 | 0.492 | |
| PPOReference Policy=Bot A2025.06 | 0.509 | |
| MPPO BReference Policy=Bot A2025.06 | 0.521 | |
| MPPO AReference Policy=Bot B2025.06 | 0.53 |