Offline Reinforcement Learning on D4RL adroit 12 tasks (Normalized Score)
59Normalized ScoreReBRAC
Evaluation Results
| Method | Links | |
|---|---|---|
| ReBRACPolicy Class=Gaussian Policy2026.04 | 59 | |
| ReBRACPolicy Category=Gaussian2026.05 | 59 | |
| IQLPolicy Class=Gaussian Policy2026.04 | 53 | |
| IQLPolicy Category=Gaussian2026.05 | 53 | |
| IFQLPolicy Class=Multi-step / Iterative Policy2026.04 | 52 | |
| DeFlowPolicy Class=Multi-step / Iterative Policy2026.04 | 52 | |
| FQLPolicy Class=One-step Method2026.04 | 52 | |
| DROLPolicy Class=One-step Method, K-selection protocol=benchmark-specific2026.04 | 52 | |
| IDQLPolicy Category=Diffusion2026.05 | 52 | |
| IFQLPolicy Category=Flow2026.05 | 52 | |
| FQLPolicy Category=Flow2026.05 | 52 | |
| DROLPolicy Class=One-step Method, K=162026.04 | 51 | |
| SRPOPolicy Category=Diffusion2026.05 | 51 | |
| FBRACPolicy Class=Multi-step / Iterative Policy2026.04 | 50 | |
| FBRACPolicy Category=Flow2026.05 | 50 | |
| DriftQLPolicy Category=Drift2026.05 | 50 | |
| BCPolicy Class=Gaussian Policy2026.04 | 48 | |
| FAWACPolicy Class=Multi-step / Iterative Policy2026.04 | 48 | |
| BCPolicy Category=Gaussian2026.05 | 48 | |
| FAWACPolicy Category=Flow2026.05 | 48 | |
| CACPolicy Category=Diffusion2026.05 | 43 |