Offline Reinforcement Learning on D4RL Antmaze medium-play
91Normalized ScoreSAGE
Evaluation Results
| Method | Links | |
|---|---|---|
| SAGEMethod Category=Diffusion Planners2026.03 | 91 | |
| DV*Method Category=Diffusion Planners2026.03 | 89 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 88 | |
| DQL*Method Category=Diffusion Policies2026.03 | 87.3 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 85 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 84.5 | |
| IDQL*Method Category=Diffusion Policies2026.03 | 84.5 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 84 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 80.7 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 80 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 78 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 71.2 | |
| IQLMethod Category=Non-Diffusion2026.03 | 71.2 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 61.2 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 56.8 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 52.5 | |
| LoMAPMethod Category=Diffusion Planners2026.03 | 40.7 | |
| SAC-RNDPolicy Type=Gaussian, Seeds=82026.02 | 38.5 | |
| CQLMethod Category=Non-Diffusion2026.03 | 14.9 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 10.6 | |
| Diffuser*Method Category=Diffusion Planners2026.03 | 6.7 | |
| BCMethod Category=IL2026.03 | 0 | |
| BCQMethod Category=Non-Diffusion2026.03 | 0 |