Offline Reinforcement Learning on D4RL AntMaze-Medium Diverse
94.7Normalized PerformanceDQL
Evaluation Results
| Method | Links | |
|---|---|---|
| DQLPolicy Type=Diffusion Policy2026.06 | 94.7 | |
| GTP2025.10 | 94.2 | |
| OFQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 90.2 | |
| SAGEMethod Category=Diffusion Planners2026.03 | 88 | |
| QIPO-OT2025.10 | 86.4 | |
| QIPO-Diff2025.10 | 86 | |
| FQL2025.10 | 85.2 | |
| DV*Method Category=Diffusion Planners2026.03 | 85.1 | |
| IDQL*Method Category=Diffusion Policies2026.03 | 84.8 | |
| BFQPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 84.1 | |
| IDQLPolicy Type=Diffusion Policy2026.06 | 83.3 | |
| DQL*Method Category=Diffusion Policies2026.03 | 82.6 | |
| IQLPolicy Type=Gaussian Policy2026.06 | 78 | |
| SRPOPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 75 | |
| FQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 71 | |
| IQLMethod Category=Non-Diffusion2026.03 | 70 | |
| SORLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 70 | |
| LDCQMethod Category=Diffusion Planners2026.03 | 68.9 | |
| EDPPolicy Type=Diffusion Policy2026.06 | 52.7 | |
| LoMAPMethod Category=Diffusion Planners2026.03 | 36 | |
| CQLMethod Category=Non-Diffusion2026.03 | 15.8 | |
| TD3-BCPolicy Type=Gaussian Policy2026.06 | 5.7 | |
| Diffuser*Method Category=Diffusion Planners2026.03 | 2 | |
| BCPolicy Type=Gaussian Policy2026.06 | 0.6 | |
| BCMethod Category=IL2026.03 | 0 | |
| BCQMethod Category=Non-Diffusion2026.03 | 0 |