Offline Reinforcement Learning on D4RL Antmaze (6 Tasks)
84Normalized ScoreFQL
Evaluation Results
| Method | Links | |
|---|---|---|
| FQLPolicy Class=One-step Method2026.04 | 84 | |
| FQLPolicy Category=Flow2026.05 | 84 | |
| DriftQLPolicy Category=Drift2026.05 | 84 | |
| DeFlowPolicy Class=Multi-step / Iterative Policy2026.04 | 83 | |
| DROLPolicy Class=One-step Method, K-selection protocol=benchmark-specific2026.04 | 81 | |
| IDQLPolicy Category=Diffusion2026.05 | 79 | |
| ReBRACPolicy Class=Gaussian Policy2026.04 | 78 | |
| DROLPolicy Class=One-step Method, K=162026.04 | 78 | |
| ReBRACPolicy Category=Gaussian2026.05 | 78 | |
| SRPOPolicy Category=Diffusion2026.05 | 74 | |
| IFQLPolicy Class=Multi-step / Iterative Policy2026.04 | 65 | |
| IFQLPolicy Category=Flow2026.05 | 65 | |
| FBRACPolicy Class=Multi-step / Iterative Policy2026.04 | 64 | |
| FBRACPolicy Category=Flow2026.05 | 64 | |
| IQLPolicy Class=Gaussian Policy2026.04 | 57 | |
| IQLPolicy Category=Gaussian2026.05 | 57 | |
| FAWACPolicy Class=Multi-step / Iterative Policy2026.04 | 44 | |
| FAWACPolicy Category=Flow2026.05 | 44 | |
| CACPolicy Category=Diffusion2026.05 | 30 | |
| BCPolicy Class=Gaussian Policy2026.04 | 17 | |
| BCPolicy Category=Gaussian2026.05 | 17 |