Offline Reinforcement Learning on puzzle-4x4-play OGBench 5 tasks v0
78Average Success RateMAC
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MACModel Paradigm=Model-Based2025.12 | 78 | — | — | — | — | — | |
| TRL2025.10 | 34 | 4,700 | 1,700 | 3,800 | 3,400 | 3,200 | |
| IDQLModel Paradigm=Model-Free2025.12 | 29 | — | — | — | — | — | |
| IQL2025.10 | 28 | 3,300 | 0 | 5,800 | 2,200 | 2,900 | |
| IQNPolicy Type=Flow Policies2025.10 | 27 | — | — | — | — | — | |
| Value FlowsPolicy Type=Flow Policies2025.10 | 27 | — | — | — | — | — | |
| IFQLPolicy Type=Flow Policies2025.10 | 25 | — | — | — | — | — | |
| CODACPolicy Type=Flow Policies2025.10 | 20 | — | — | — | — | — | |
| FQLModel Paradigm=Model-Free2025.12 | 17 | — | — | — | — | — | |
| FQLPolicy Type=Flow Policies2025.10 | 17 | — | — | — | — | — | |
| ReBRACModel Paradigm=Model-Free2025.12 | 14 | — | — | — | — | — | |
| ReBRACPolicy Type=Gaussian Policies2025.10 | 14 | — | — | — | — | — | |
| FBRACPolicy Type=Flow Policies2025.10 | 13 | — | — | — | — | — | |
| IQLModel Paradigm=Model-Free2025.12 | 7 | — | — | — | — | — | |
| IQLPolicy Type=Gaussian Policies2025.10 | 7 | — | — | — | — | — | |
| IVL2025.10 | 5 | 600 | 400 | 600 | 600 | 600 | |
| FBC2025.10 | 1 | 100 | 100 | 100 | 100 | 0 | |
| MOPOModel Paradigm=Model-Based2025.12 | 0 | — | — | — | — | — | |
| MOBILEModel Paradigm=Model-Based2025.12 | 0 | — | — | — | — | — | |
| LEQModel Paradigm=Model-Based2025.12 | 0 | — | — | — | — | — | |
| FMPCModel Paradigm=Model-Based2025.12 | 0 | — | — | — | — | — | |
| BC2025.10 | 0 | 100 | 0 | 0 | 100 | 0 | |
| CRL2025.10 | 0 | 100 | 0 | 100 | 100 | 0 | |
| QRL2025.10 | 0 | 0 | 0 | 0 | 0 | 0 | |
| TDP2025.10 | 0 | 100 | 0 | 100 | 0 | 100 | |
| COE2025.10 | 0 | 0 | 100 | 0 | 0 | 0 | |
| BCPolicy Type=Gaussian Policies2025.10 | 0 | — | — | — | — | — | |
| C51Policy Type=Flow Policies2025.10 | 0 | — | — | — | — | — |