Offline Reinforcement Learning on OGBench cube-single-singletask 5 tasks
100Normalized ScoreGTP
Evaluation Results
| Method | Links | |
|---|---|---|
| GTPobservation_type=state-based, averaging=5 tasks2025.10 | 100 | |
| DROLPolicy Class=One-step Method, K-selection protocol=benchmark-specific2026.04 | 98 | |
| SORLPolicy Class=Multi-step / Iterative Policy2026.04 | 97 | |
| DROLPolicy Class=One-step Method, K=162026.04 | 97 | |
| DeFlowPolicy Class=Multi-step / Iterative Policy2026.04 | 96 | |
| FQLPolicy Class=One-step Method2026.04 | 96 | |
| FQLobservation_type=state-based, averaging=5 tasks2025.10 | 96 | |
| ReBRACPolicy Class=Gaussian Policy2026.04 | 91 | |
| CACobservation_type=state-based, averaging=5 tasks2025.10 | 85 | |
| IQLPolicy Class=Gaussian Policy2026.04 | 83 | |
| FAWACPolicy Class=Multi-step / Iterative Policy2026.04 | 81 | |
| FBRACPolicy Class=Multi-step / Iterative Policy2026.04 | 79 | |
| IFQLPolicy Class=Multi-step / Iterative Policy2026.04 | 79 | |
| BCPolicy Class=Gaussian Policy2026.04 | 5 |