Reinforcement Learning on AntMaze umaze D4RL
623Average Episodic ReturnGC-Oracle
Evaluation Results
| Method | Links | |
|---|---|---|
| GC-Oracle2024.03 | 623 | |
| DiSPO2024.03 | 593 | |
| COMBO2024.03 | 574 | |
| GC-IQL2024.03 | 571 | |
| FB2024.03 | 469 | |
| USFA2024.03 | 462 | |
| RaMP2024.03 | 459 | |
| MOPO2024.03 | 451 | |
| CQLLearning Phase=Offline RL2026.04 | 94 | |
| O2O-LSVILearning Phase=Offline-to-Online Adaptation2026.04 | 85.8 | |
| IQLLearning Phase=Offline RL2026.04 | 77 | |
| Cal-QLLearning Phase=Offline-to-Online Adaptation2026.04 | 76.8 |