Offline Reinforcement Learning on D4RL AntMaze v0 (medium-play)
88.1Normalized ScoreOFQL
Evaluation Results
| Method | Links | |
|---|---|---|
| OFQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 88.1 | |
| BFQPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 87 | |
| DQLPolicy Type=Diffusion Policy2026.06 | 86 | |
| GTP2025.10 | 83.3 | |
| QIPO-Diff2025.10 | 82.8 | |
| SRPOPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 80.7 | |
| SORLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 80.1 | |
| QIPO-OT2025.10 | 80 | |
| FQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 78 | |
| IQLPolicy Type=Gaussian Policy2026.06 | 75.5 | |
| EDPPolicy Type=Diffusion Policy2026.06 | 73.3 | |
| IDQLPolicy Type=Diffusion Policy2026.06 | 67.3 | |
| TD3-BCPolicy Type=Gaussian Policy2026.06 | 10.6 | |
| TD3+BCEvaluations=final 10, Seeds=5, State feature normalization=false2021.06 | 3 | |
| BCPolicy Type=Gaussian Policy2026.06 | 0 |