Offline Reinforcement Learning on D4RL Antmaze umaze, medium, large v2
0.967UMaze ScoreRORL
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| RORLEnsemble type=Ensemble-based2024.10 | 0.967 | 0.907 | 0.763 | 0.693 | 0.163 | 0.41 | 390.3 | |
| DQLEnsemble type=Ensemble-free2024.10 | 0.934 | 0.662 | 0.766 | 0.786 | 0.464 | 0.566 | 417.8 | |
| EQLEnsemble type=Ensemble-free2024.10 | 0.932 | 0.654 | 0.775 | 0.7 | 0.456 | 0.425 | 394.2 | |
| SQLEnsemble type=Ensemble-free2024.10 | 0.922 | 0.74 | 0.802 | 0.791 | 0.532 | 0.523 | 431 | |
| SCAS-htEnsemble type=Ensemble-free, Hyperparameter tuning=λ from {0.025, 0.25}2024.10 | 0.904 | 0.664 | 0.836 | 0.846 | 0.594 | 0.562 | 440.6 | |
| DW+IQLEnsemble type=Ensemble-free2024.10 | 0.813 | 0.61 | 0.787 | 0.647 | 0.4 | 0.42 | 367.7 | |
| DW+CQLEnsemble type=Ensemble-free2024.10 | 0.727 | 0.34 | 0.04 | 0.013 | 0.02 | 0 | 114 | |
| EDACEnsemble type=Ensemble-based2024.10 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |