Offline Reinforcement Learning on D4RL HalfCheetah Medium v2
77.9Average Normalized ReturnRAMBO
Evaluation Results
| Method | Links | |
|---|---|---|
| RAMBOModel category=Model-based2026.05 | 77.9 | |
| PMDBModel category=Model-based2026.05 | 75.6 | |
| PhyBModel category=Model-based2026.05 | 74.5 | |
| MOPO2026.02 | 73.1 | |
| ADMModel category=Model-based2026.05 | 72.2 | |
| Uncertainty-Aware Rank-One MIMO Q Network2026.02 | 68.6 | |
| EPQModel category=Model-free2026.05 | 67.3 | |
| EDAC-102026.02 | 64.1 | |
| CPED2023.01 | 61.8 | |
| MOReLModel category=Model-based2026.05 | 60.7 | |
| FQLModel category=Model-free2026.05 | 59.9 | |
| SPOT2022.02 | 58.4 | |
| SPOT2023.01 | 58.4 | |
| PBRL2026.02 | 57.9 | |
| DMGModel category=Model-free2026.05 | 54.9 | |
| Onestep2022.02 | 48.4 | |
| Onestep RL2023.01 | 48.4 | |
| TD3+BC2022.02 | 48.3 | |
| TD3+BC2023.01 | 48.3 | |
| TD3-BC2026.02 | 48.3 | |
| IQL2022.02 | 47.4 | |
| IQL2023.01 | 47.4 | |
| CQL2026.02 | 47 | |
| Trajectory Transformerdiscretization=quantile2021.06 | 46.9 | |
| CQLModel category=Model-free2026.05 | 46.9 | |
| BRAC2021.06 | 46.3 | |
| MBOP2021.06 | 44.6 | |
| CQL2021.06 | 44 | |
| Trajectory Transformerdiscretization=uniform2021.06 | 44 | |
| CQL2022.02 | 44 | |
| CQL2023.01 | 44 | |
| GACStrategy=Exploitation query (GAC-E[y])2025.12 | 43.6 | |
| AWAC2022.02 | 43.5 | |
| AWAC2023.01 | 43.5 | |
| Behavior Cloning2021.06 | 43.1 | |
| LPT2025.12 | 43.1 | |
| BEAR2026.02 | 43 | |
| TD3+BCModel category=Model-free2026.05 | 42.8 | |
| Decision Transformer2021.06 | 42.6 | |
| BC2022.02 | 42.6 | |
| DT2022.02 | 42.6 | |
| BC2023.01 | 42.6 | |
| DT2023.01 | 42.6 | |
| GACStrategy=Fixed target steering (GAC-y*)2025.12 | 42.5 | |
| DT2025.12 | 42.4 | |
| QDT2025.12 | 42.4 | |
| UWAV2026.02 | 42.2 | |
| IQL2026.02 | 41.7 | |
| GACStrategy=Exploration query (GAC-p(y+))2025.12 | 41.5 | |
| GACStrategy=Sampling from prior (p(y|z)p(z))2025.12 | 41.2 | |
| BCQ2026.02 | 40.1 | |
| IQL2025.12 | 8.5 | |
| CQL2025.12 | 1 |