Offline Reinforcement Learning on Hopper medium-expert
114Normalized ScoreQ-ALIGN DT
Evaluation Results
| Method | Links | |
|---|---|---|
| Q-ALIGN DT2026.05 | 114 | |
| QT2026.05 | 113.4 | |
| DM2026.05 | 111.8 | |
| LSDT2026.05 | 111.7 | |
| TD3-CVAE2026.02 | 111.6 | |
| O-DICE2026.02 | 110.8 | |
| DMG2026.02 | 110.4 | |
| DC2026.05 | 110.4 | |
| RADT2026.05 | 110.4 | |
| QCS2026.05 | 110.2 | |
| SAC-RND2026.02 | 109.8 | |
| GPC-SAC2026.02 | 109.8 | |
| DT2026.05 | 107.6 | |
| CGDT2026.05 | 107.6 | |
| I-TAPNoise=1.252026.02 | 106.91 | |
| CQL2026.02 | 105.6 | |
| Anti-exploration Method2026.02 | 102.9 | |
| TD3+BC2026.05 | 98 | |
| L-MAPNoise=1.252026.02 | 94.65 | |
| IQL2026.02 | 91.5 | |
| IQL2026.05 | 91.5 | |
| DTNoise=1.252026.02 | 87.41 | |
| I-TAPNoise=3.752026.02 | 85.07 | |
| L-MAPNoise=3.752026.02 | 80.51 | |
| I-TAPNoise=7.52026.02 | 70.43 | |
| DTNoise=3.752026.02 | 64.97 | |
| L-MAPNoise=7.52026.02 | 62.9 | |
| DTNoise=7.52026.02 | 58.96 | |
| DVDF-IGDF2025.12 | 43.2 | |
| IQL2025.12 | 38.3 | |
| DVDF-OTDF2025.12 | 37.4 | |
| IGDF2025.12 | 36.3 | |
| OTDF2025.12 | 31.6 | |
| DARA2025.12 | 19.7 | |
| BOSA2025.12 | 10.2 |