Offline Reinforcement Learning on antmaze medium-play
85.6ScoreQ-ALIGN DT
Evaluation Results
| Method | Links | |
|---|---|---|
| Q-ALIGN DT2026.05 | 85.6 | |
| QCS-GAlgorithm Category=Ours, Conditioning Strategy=Goal2024.02 | 84.8 | |
| PORAlgorithm Category=Combined2024.02 | 84.6 | |
| GCIQL2023.07 | 82.6 | |
| QCS-RAlgorithm Category=Ours, Conditioning Strategy=Return2024.02 | 81.6 | |
| QCS2026.05 | 81.6 | |
| SQLAlgorithm Category=Value-Based Method2024.02 | 80.2 | |
| SPQRBase algorithm=CQL-Min2024.01 | 80 | |
| QT2026.05 | 78.6 | |
| TAP2023.07 | 78 | |
| DWSL2023.07 | 77.6 | |
| RORL2022.06 | 76.3 | |
| IQL2023.07 | 75.8 | |
| IQL+smoothing2022.06 | 75.3 | |
| CQL2023.07 | 72.8 | |
| RvS-G2023.07 | 71.8 | |
| IQL2022.06 | 71.2 | |
| IQL2024.01 | 71.2 | |
| IQLAlgorithm Category=Value-Based Method2024.02 | 71.2 | |
| IQL2026.05 | 71.2 | |
| GCPC2023.07 | 70.8 | |
| WGCSL2023.07 | 63.2 | |
| CQL2022.06 | 61.2 | |
| CQL-Min2024.01 | 61.2 | |
| CQLAlgorithm Category=Value-Based Method2024.02 | 61.2 | |
| CQL2026.05 | 61.2 | |
| RvS-GAlgorithm Category=RCSL, Conditioning Strategy=Goal2024.02 | 58.1 | |
| ROMI+BCQ2022.06 | 35.3 | |
| DCAlgorithm Category=RCSL2024.02 | 33.2 | |
| DC2026.05 | 33.2 | |
| TD3+BC2022.06 | 10.6 | |
| TD3+BCAlgorithm Category=Value-Based Method2024.02 | 10.6 | |
| TD3+BC2026.05 | 10.6 | |
| RvS-RAlgorithm Category=RCSL, Conditioning Strategy=Return2024.02 | 4.5 | |
| RVS2026.05 | 4.5 | |
| DTAlgorithm Category=RCSL2024.02 | 4.3 | |
| DT2026.05 | 4.3 | |
| BC2023.07 | 0.6 | |
| BC2022.06 | 0 | |
| AWAC2022.06 | 0 | |
| DT2023.07 | 0 | |
| BC2024.01 | 0 | |
| SAC-Min2024.01 | 0 | |
| BEAR2024.01 | 0 |