Offline Reinforcement Learning (Navigation) on AntMaze umaze D4RL
91Expert Normalized ReturnDMM
Evaluation Results
| Method | Links | |
|---|---|---|
| DMMArchitecture=SSM-based2026.02 | 91 | |
| IQLArchitecture=Value-based2026.02 | 87.5 | |
| DCArchitecture=Transformer-based2026.02 | 85 | |
| TD3+BCArchitecture=Value-based2026.02 | 78.6 | |
| CQLArchitecture=Value-based2026.02 | 74 | |
| DMArchitecture=SSM-based2026.02 | 68 | |
| QLDTArchitecture=Transformer-based2026.02 | 67.2 | |
| WTArchitecture=Transformer-based2026.02 | 64.9 | |
| DS4Architecture=SSM-based2026.02 | 63.4 | |
| DTArchitecture=Transformer-based2026.02 | 53.6 |