Offline Reinforcement Learning on D4RL Adroit door-human
21.1Mean Normalized ScoreQQL
Evaluation Results
| Method | Links | |
|---|---|---|
| QQLDomain=Adroit, Hyperparameter Tuning=consistent2025.11 | 21.1 | |
| MXQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 18.3 | |
| IQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 13.5 | |
| CQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 13.3 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 13.2 | |
| XQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 13.2 | |
| MoMoModel paradigm=Conservative model-based, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 11.3 | |
| EDACModel paradigm=Model-free, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 10.7 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 9.9 | |
| BCDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 9.4 | |
| ARMORModel paradigm=Conservative model-based, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 6.3 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 6 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 5.5 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 5 | |
| IQLModel paradigm=Model-free, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 3.3 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 3.1 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 3 | |
| BCModel paradigm=Model-free, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 2.3 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 2.3 | |
| VIPOModel paradigm=Conservative model-based, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 2 | |
| NEUBAYModel paradigm=Ours, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0 | |
| SAC-RNDPolicy Type=Gaussian, Seeds=82026.02 | 0 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 0 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 0 | |
| ReBRACModel paradigm=Model-free, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | -0.1 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | -0.1 | |
| TD3+BCDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | -0.1 | |
| MOPOModel paradigm=Conservative model-based, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | -0.2 | |
| MOBILEModel paradigm=Conservative model-based, pi_D=7.7, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | -0.2 |