Offline Reinforcement Learning on MuJoCo hopper-medium D4RL
101.3Normalized ReturnISEP-FM
Evaluation Results
| Method | Links | |
|---|---|---|
| ISEP-FMFlow Matching=true2026.05 | 101.3 | |
| QGPO2026.05 | 98 | |
| CGDTMethod Category=Combined Method2024.02 | 96.9 | |
| QCS-RMethod Category=Ours2024.02 | 96.4 | |
| QIPO2026.05 | 94 | |
| DCMethod Category=RCSL2024.02 | 92.5 | |
| DQL2026.05 | 90.5 | |
| CQL2026.05 | 79.2 | |
| ISEPFlow Matching=false2026.05 | 79.1 | |
| PORMethod Category=Combined Method2024.02 | 78.6 | |
| SQLMethod Category=Value-Based2024.02 | 75.5 | |
| ACTMethod Category=Combined Method2024.02 | 67.8 | |
| DTMethod Category=RCSL2024.02 | 67.6 | |
| IQL2026.05 | 67 | |
| QDTMethod Category=Combined Method2024.02 | 66.5 | |
| IQLMethod Category=Value-Based2024.02 | 66.3 | |
| EDTMethod Category=Combined Method2024.02 | 63.5 | |
| IDQL2026.05 | 63.1 | |
| RvS-RMethod Category=RCSL2024.02 | 60.2 | |
| TD3+BCMethod Category=Value-Based2024.02 | 59.3 | |
| CQLMethod Category=Value-Based2024.02 | 58.5 | |
| BC2026.05 | 52.9 |