Offline Reinforcement Learning on D4RL MuJoCo halfcheetah-medium
69.1Normalized ScoreCAC
Evaluation Results
| Method | Links | |
|---|---|---|
| CACPolicy Type=Diffusion, Seeds=82026.02 | 69.1 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 67.3 | |
| BFQPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 66.1 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 65.6 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 65 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 64.3 | |
| OFQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 63.8 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 60.4 | |
| SRPOPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 60.4 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 60.3 | |
| FQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 60.1 | |
| ISEP-FMFlow Matching=true2026.05 | 59.9 | |
| SPOTPolicy Type=Gaussian, Seeds=82026.02 | 58.4 | |
| SORLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 57.4 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 54.2 | |
| QGPO2026.05 | 54.1 | |
| QIPO2026.05 | 54.1 | |
| DQLPolicy Type=Diffusion Policy2026.06 | 52.3 | |
| IDQLPolicy Type=Diffusion Policy2026.06 | 51.5 | |
| DQL2026.05 | 51.1 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 51 | |
| EDPPolicy Type=Diffusion Policy2026.06 | 50.8 | |
| IDQL2026.05 | 49.7 | |
| ISEPFlow Matching=false2026.05 | 49.3 | |
| TD3-BCPolicy Type=Gaussian Policy2026.06 | 48.5 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 48.3 | |
| IQLPolicy Type=Gaussian Policy2026.06 | 47.7 | |
| IQL2026.05 | 47.5 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 47.4 | |
| CQL2026.05 | 44.4 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 44 | |
| BC2026.05 | 42.6 | |
| BCPolicy Type=Gaussian Policy2026.06 | 42.5 |