Offline Reinforcement Learning on OGBench puzzle-4x4 singletask 5 tasks
25Normalized ScoreIFQL
Evaluation Results
| Method | Links | |
|---|---|---|
| IFQLPolicy Class=Multi-step / Iterative Policy2026.04 | 25 | |
| DROLPolicy Class=One-step Method, K-selection protocol=benchmark-specific2026.04 | 25 | |
| FQLPolicy Class=One-step Method2026.04 | 17 | |
| DROLPolicy Class=One-step Method, K=162026.04 | 16 | |
| ReBRACPolicy Class=Gaussian Policy2026.04 | 14 | |
| FBRACPolicy Class=Multi-step / Iterative Policy2026.04 | 13 | |
| DeFlowPolicy Class=Multi-step / Iterative Policy2026.04 | 11 | |
| IQLPolicy Class=Gaussian Policy2026.04 | 7 | |
| FAWACPolicy Class=Multi-step / Iterative Policy2026.04 | 1 | |
| BCPolicy Class=Gaussian Policy2026.04 | 0 |