Offline Reinforcement Learning on kitchen mixed
77.8Normalized ScoreWGCSL
Evaluation Results
| Method | Links | |
|---|---|---|
| WGCSL2023.07 | 77.8 | |
| GCPC2023.07 | 75.6 | |
| GCIQL2023.07 | 74.6 | |
| DWSL2023.07 | 74.6 | |
| RvS-G2023.07 | 69.4 | |
| DD2023.07 | 65 | |
| SPQRBase algorithm=CQL-Min2024.01 | 55.6 | |
| IQL2023.07 | 53.2 | |
| DPPOFramework=Preference Transformer (PT)2023.01 | 52.5 | |
| DPPOsupervision=preference only, seeds=52023.01 | 52.5 | |
| CQL2023.07 | 52.4 | |
| CQLReward Specification=Step-wise2024.02 | 51 | |
| IQL2024.01 | 51 | |
| CQL-Min2024.01 | 51 | |
| DT2023.07 | 50.7 | |
| IQLsupervision=task rewards, seeds=52023.01 | 50.6 | |
| BC2023.07 | 48.9 | |
| PT+IQLFramework=Preference Transformer (PT)2023.01 | 48 | |
| PT+IQLsupervision=preference only, seeds=52023.01 | 48 | |
| BC2024.01 | 47.5 | |
| BEAR2024.01 | 47.2 | |
| PT+%BCFramework=Preference Transformer (PT)2023.01 | 40.9 | |
| PT+RvSFramework=Preference Transformer (PT)2023.01 | 27.5 | |
| DTReward Specification=Step-wise2024.02 | 22.3 | |
| DTReward Specification=Final Return2024.02 | 17.2 | |
| PT+CQLFramework=Preference Transformer (PT)2023.01 | 12.3 | |
| PT+CQLsupervision=preference only, seeds=52023.01 | 12.3 | |
| CQLsupervision=task rewards, seeds=52023.01 | 10.7 | |
| SAC-Min2024.01 | 2.5 |