Policy Optimization on Office World MAP0
4,150Avg Training StepsQR-MAXRM
Evaluation Results
| Method | Links | |
|---|---|---|
| QR-MAXRMExp=EXP02025.12 | 4,150 | |
| QR-MAXRM2025.12 | 4,150 | |
| QR-MAXExp=EXP02025.12 | 14,483 | |
| QR-MAX2025.12 | 14,483 | |
| R-MAXExp=EXP02025.12 | 49,759 | |
| R-MAX2025.12 | 49,759 | |
| PSRLExp=EXP0, posterior_samples=8 per episode2025.12 | 88,437 | |
| PSRLposterior samples per episode=82025.12 | 88,437 | |
| OPSRLExp=EXP0, posterior_samples=8 per episode2025.12 | 128,188 | |
| OPSRLposterior samples per episode=82025.12 | 128,188 | |
| UCBVI-sBExp=EXP02025.12 | 142,015 | |
| UCBVI-sB2025.12 | 142,015 | |
| UCBVI-BExp=EXP02025.12 | 159,092 | |
| UCBVI-B2025.12 | 159,092 | |
| QRMExp=EXP02025.12 | 162,040 | |
| QRM2025.12 | 162,040 | |
| UCBVI-HExp=EXP02025.12 | 191,983 | |
| UCBVI-H2025.12 | 191,983 |