Reinforcement Learning on AntMaze large-play D4RL
533Average Episodic ReturnGC-Oracle
Evaluation Results
| Method | Links | |
|---|---|---|
| GC-Oracle2024.03 | 533 | |
| DiSPO2024.03 | 306 | |
| USFA2024.03 | 250 | |
| COMBO2024.03 | 248 | |
| GC-IQL2024.03 | 229 | |
| FB2024.03 | 165 | |
| RaMP2024.03 | 134 | |
| MOPO2024.03 | 128 | |
| IQLLearning Phase=Offline RL2026.04 | 38.5 | |
| O2O-LSVILearning Phase=Offline-to-Online Adaptation2026.04 | 35.3 | |
| Cal-QLLearning Phase=Offline-to-Online Adaptation2026.04 | 31.8 | |
| CQLLearning Phase=Offline RL2026.04 | 28.8 |