Offline Reinforcement Learning on puzzle-3x3-play OGBench 5 tasks v0
87Average Success RateValue Flows
Evaluation Results
| Method | Links | |
|---|---|---|
| Value FlowsPolicy Type=Flow Policies2025.10 | 87 | |
| FQLModel Paradigm=Model-Free2025.12 | 30 | |
| FQLPolicy Type=Flow Policies2025.10 | 30 | |
| ReBRACPolicy Type=Gaussian Policies2025.10 | 22 | |
| ReBRACModel Paradigm=Model-Free2025.12 | 21 | |
| MOPOModel Paradigm=Model-Based2025.12 | 20 | |
| MACModel Paradigm=Model-Based2025.12 | 20 | |
| CODACPolicy Type=Flow Policies2025.10 | 20 | |
| IFQLPolicy Type=Flow Policies2025.10 | 19 | |
| IQNPolicy Type=Flow Policies2025.10 | 15 | |
| FBRACPolicy Type=Flow Policies2025.10 | 14 | |
| MOBILEModel Paradigm=Model-Based2025.12 | 12 | |
| IDQLModel Paradigm=Model-Free2025.12 | 10 | |
| LEQModel Paradigm=Model-Based2025.12 | 10 | |
| IQLModel Paradigm=Model-Free2025.12 | 9 | |
| IQLPolicy Type=Gaussian Policies2025.10 | 9 | |
| BCPolicy Type=Gaussian Policies2025.10 | 2 | |
| FMPCModel Paradigm=Model-Based2025.12 | 1 | |
| C51Policy Type=Flow Policies2025.10 | 1 |