Offline Reinforcement Learning on D4RL MuJoCo Hopper medium standard
106.6Normalized ScoreMOBILE
Evaluation Results
| Method | Links | |
|---|---|---|
| MOBILELearning Approach=Model-Based2024.02 | 106.6 | |
| OFQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 103.6 | |
| BFQPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 103.5 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 102 | |
| EDACLearning Approach=Model-Free2024.02 | 101.6 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 101.3 | |
| Decision Mamba2024.06 | 98.5 | |
| COMBOLearning Approach=Model-Based2024.02 | 97.2 | |
| Critic-Guided Decision Transformer2024.06 | 96.9 | |
| DQLPolicy Type=Diffusion Policy2026.06 | 96.5 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 95.5 | |
| SRPOPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 95.5 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 94.1 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 91.9 | |
| RAVLLearning Approach=Model-Based2024.02 | 90.6 | |
| RAMBOLearning Approach=Model-Based2024.02 | 87 | |
| SPOTPolicy Type=Gaussian, Seeds=82026.02 | 86 | |
| SORLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 81.3 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 80.7 | |
| Decision Diffuser2024.06 | 79.3 | |
| DD2023.10 | 79.3 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 78.4 | |
| FQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 74.5 | |
| EDPPolicy Type=Diffusion Policy2026.06 | 72.6 | |
| IDQLPolicy Type=Diffusion Policy2026.06 | 70.1 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 68.1 | |
| DTConfiguration=base2023.10 | 67.6 | |
| TTConfiguration=Trifle2023.10 | 67.1 | |
| IQL2023.10 | 66.3 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 66.3 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 65.4 | |
| MOPOLearning Approach=Model-Based2024.02 | 62.8 | |
| CQLLearning Approach=Model-Free2024.02 | 61.9 | |
| IQLPolicy Type=Gaussian Policy2026.06 | 61.2 | |
| Trajectory Transformer2024.06 | 61.1 | |
| TTConfiguration=base2023.10 | 61.1 | |
| TD3(+BC)2023.10 | 59.3 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 59.3 | |
| Diffuser2024.06 | 58.5 | |
| CQL2023.10 | 58.5 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 58.5 | |
| TT(+Q)Configuration=Trifle2023.10 | 57.8 | |
| %BC2023.10 | 56.9 | |
| TD3-BCPolicy Type=Gaussian Policy2026.06 | 56.6 | |
| TT(+Q)Configuration=base2023.10 | 55.2 | |
| BCLearning Approach=Model-Free2024.02 | 54.1 | |
| BCPolicy Type=Gaussian Policy2026.06 | 52.9 |