Offline Reinforcement Learning on D4RL walker2d medium-replay v2
100.6Normalized ScoreUncertainty-Aware Rank-One MIMO Q Network
Evaluation Results
| Method | Links | |
|---|---|---|
| Uncertainty-Aware Rank-One MIMO Q Network2026.02 | 100.6 | |
| ADMModel category=Model-based2026.05 | 95.6 | |
| EDAC-102026.02 | 94 | |
| CPED2023.01 | 91.9 | |
| SPOT2023.01 | 91.6 | |
| DMGModel category=Model-free2026.05 | 89.7 | |
| RAMBOModel category=Model-based2026.05 | 89.2 | |
| EDAC2022.10 | 87.1 | |
| PhyBModel category=Model-based2026.05 | 85.4 | |
| EPQModel category=Model-free2026.05 | 85.3 | |
| TD3+BC2023.01 | 81.8 | |
| CQL2026.02 | 81.8 | |
| TD3-BC2026.02 | 81.8 | |
| PMDBN=10, k=22022.10 | 79.9 | |
| PMDBModel category=Model-based2026.05 | 79.9 | |
| PBRL2026.02 | 77.7 | |
| CQL2023.01 | 77.2 | |
| CQL2022.10 | 76.8 | |
| CQLModel category=Model-free2026.05 | 76.8 | |
| IQL2023.01 | 73.8 | |
| MOPO2026.02 | 73.7 | |
| IQL2026.02 | 70.9 | |
| DT2023.01 | 66.6 | |
| TAILO2023.11 | 61.2 | |
| MOReL2023.11 | 49.8 | |
| Onestep RL2023.01 | 49.5 | |
| MOReL2022.10 | 40.8 | |
| MOReLModel category=Model-based2026.05 | 40.8 | |
| BRAC2022.10 | 40.1 | |
| MOPO2023.11 | 39 | |
| DROCOShift Type=Kinematic2025.12 | 27.7 | |
| AWAC2023.01 | 27 | |
| BC2023.01 | 26 | |
| TD3+BCModel category=Model-free2026.05 | 25.2 | |
| UWAV2026.02 | 23.6 | |
| BC2022.10 | 20.3 | |
| CQLShift Type=Kinematic2025.12 | 17.8 | |
| DARAShift Type=Kinematic2025.12 | 15.6 | |
| BCQ2026.02 | 15.2 | |
| IQLShift Type=Kinematic2025.12 | 12.6 | |
| BEAR2022.10 | 12.2 | |
| FQLModel category=Model-free2026.05 | 11.4 | |
| IGDFShift Type=Kinematic2025.12 | 11.2 | |
| OTDFShift Type=Kinematic2025.12 | 10.7 | |
| BEAR2026.02 | 7 | |
| BOSAShift Type=Kinematic2025.12 | 4.8 |