Offline Reinforcement Learning on D4RL Adroit door-cloned
24Mean Normalized ScoreMOBILE
Evaluation Results
| Method | Links | |
|---|---|---|
| MOBILEModel paradigm=Conservative model-based, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 24 | |
| MOPOModel paradigm=Conservative model-based, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 15.3 | |
| EDACModel paradigm=Model-free, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 9.6 | |
| IQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 9 | |
| QQLDomain=Adroit, Hyperparameter Tuning=consistent2025.11 | 8.8 | |
| MoMoModel paradigm=Conservative model-based, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 5.8 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 5.8 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 4.1 | |
| BCDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 3.4 | |
| IQLModel paradigm=Model-free, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 3.1 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 2 | |
| MXQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 1.8 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 1.3 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 1.1 | |
| XQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 1.1 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 1 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 0.8 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 0.4 | |
| SAC-RNDPolicy Type=Gaussian, Seeds=82026.02 | 0.2 | |
| ReBRACModel paradigm=Model-free, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0.1 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 0.1 | |
| NEUBAYModel paradigm=Ours, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 0 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 0 | |
| BCModel paradigm=Model-free, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | -0.1 | |
| ARMORModel paradigm=Conservative model-based, pi_D=3.2, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | -0.1 | |
| CQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | -0.1 | |
| TD3+BCDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | -0.2 |