Offline Reinforcement Learning on D4RL MuJoCo walker2d-medium-replay
95.5ScoreDQL
Evaluation Results
| Method | Links | |
|---|---|---|
| DQL2026.05 | 95.5 | |
| ISEP-FMFlow Matching=true2026.05 | 92.7 | |
| SPOTPolicy Type=Gaussian, Seeds=82026.02 | 91.6 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 91.3 | |
| QIPO2026.05 | 90.1 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 85.3 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 85.1 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 84.6 | |
| QGPO2026.05 | 84.4 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 83 | |
| ISEPFlow Matching=false2026.05 | 82 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 81.8 | |
| IDQL2026.05 | 79.8 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 79.5 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 78.6 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 77.3 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 77.2 | |
| CQL2026.05 | 77.2 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 73.9 | |
| IQL2026.05 | 73.9 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 53.1 | |
| BC2026.05 | 26 |