Offline Reinforcement Learning on D4RL Adroit hammer-human
860Normalized ScoreFAC
Evaluation Results
| Method | Links | |
|---|---|---|
| FACPolicy Type=Flow, Seeds=82026.02 | 860 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 440 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 390 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 250 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 200 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 200 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 100 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 100 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 40 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 30 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 20 | |
| MXQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 14.7 | |
| BCDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 12.6 | |
| QQLDomain=Adroit, Hyperparameter Tuning=consistent2025.11 | 8.4 | |
| XQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 7.3 | |
| IQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 6.9 | |
| BCModel paradigm=Model-free, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 3 | |
| TD3+BCDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 2.4 | |
| ARMORModel paradigm=Conservative model-based, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 1.9 | |
| IQLModel paradigm=Model-free, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 1.8 | |
| MoMoModel paradigm=Conservative model-based, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 1.7 | |
| VIPOModel paradigm=Conservative model-based, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 1.1 | |
| EDACModel paradigm=Model-free, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0.8 | |
| MOBILEModel paradigm=Conservative model-based, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0.4 | |
| MOPOModel paradigm=Conservative model-based, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0.3 | |
| CQLDomain=Adroit, Hyperparameter Tuning=individually tuned2025.11 | 0.3 | |
| ReBRACModel paradigm=Model-free, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0.2 | |
| NEUBAYModel paradigm=Ours, pi_D=1.5, Number of seeds=6, Evaluation episodes=20, Evaluation step=final step2025.12 | 0 | |
| SAC-RNDPolicy Type=Gaussian, Seeds=82026.02 | -10 |