Reinforcement Learning on Windy Lunar Lander standard (test)
32.73Expected Value (E)QR-DQN
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| QR-DQN2025.01 | 32.73 | 3.79 | -24.79 | 4.23 | |
| QR-SRMRisk-measure parameterization=phi_alpha3, w32025.01 | 31.7 | 14.17 | -2.85 | 14.57 | |
| QR-SRMRisk-measure parameterization=phi_alpha=1.02025.01 | 27.36 | 10.17 | -8.07 | 9.82 | |
| QR-SRMRisk-measure parameterization=phi_alpha=0.52025.01 | 23.25 | 4.12 | -12.26 | 5.67 | |
| QR-SRMRisk-measure parameterization=phi_alpha=0.22025.01 | 22.28 | 3.37 | -13.51 | 4.57 | |
| QR-iCVaRalpha=0.52025.01 | 21.72 | -1.33 | -22.37 | -0.02 | |
| QR-iCVaRalpha=0.22025.01 | 18.53 | -2.69 | -18.82 | 0.04 | |
| QR-CVaRalpha=12025.01 | 14.52 | -1.51 | -15.58 | -0.45 | |
| QR-CVaRalpha=0.22025.01 | 11.85 | -4.78 | -19.09 | -3.53 | |
| QR-CVaRalpha=0.52025.01 | 10.77 | -6.26 | -21.07 | -5.08 |