Offline Reinforcement Learning on Walker2d medium-expert
121.4Normalized ScoreQ-ALIGN DT
Evaluation Results
| Method | Links | |
|---|---|---|
| Q-ALIGN DT2026.05 | 121.4 | |
| QCS2026.05 | 116.6 | |
| DMG2026.02 | 114.4 | |
| Anti-exploration Method2026.02 | 112.8 | |
| DM2026.05 | 112.7 | |
| QT2026.05 | 112.6 | |
| GPC-SAC2026.02 | 111.7 | |
| O-DICE2026.02 | 110.8 | |
| TD3+BC2026.05 | 110.1 | |
| LSDT2026.05 | 109.8 | |
| RADT2026.05 | 109.7 | |
| IQL2026.02 | 109.6 | |
| IQL2026.05 | 109.6 | |
| DC2026.05 | 109.6 | |
| CGDT2026.05 | 109.3 | |
| DT2026.05 | 108.1 | |
| CQL2026.02 | 107.9 | |
| SAC-RND2026.02 | 105 | |
| I-TAPNoise=3.52026.02 | 98.8 | |
| L-MAPNoise=3.52026.02 | 96.53 | |
| I-TAPNoise=9.52026.02 | 94.29 | |
| L-MAPNoise=9.52026.02 | 92.31 | |
| I-TAPNoise=152026.02 | 88.26 | |
| L-MAPNoise=152026.02 | 87.21 | |
| TD3-CVAE2026.02 | 84.9 | |
| DROCO2025.12 | 78.9 | |
| IGDF2025.12 | 75.7 | |
| OTDF2025.12 | 66.7 | |
| DTNoise=3.52026.02 | 65.07 | |
| DTNoise=9.52026.02 | 56.23 | |
| BOSA2025.12 | 46.7 | |
| DTNoise=152026.02 | 44.07 | |
| DARA2025.12 | 42.2 | |
| IQL*variant=tuned/reproduced2025.12 | 27.6 | |
| DVDF-OTDF2025.12 | 23 | |
| CQL*variant=tuned/reproduced2025.12 | 22.4 | |
| DVDF-IGDF2025.12 | 20.9 | |
| IQL2025.12 | 16.7 | |
| OTDF2025.12 | 15.4 | |
| BOSA2025.12 | 12.8 | |
| IGDF2025.12 | 12.6 | |
| DARA2025.12 | 10.2 |