Offline Reinforcement Learning on OGBench Hard single tasks
36Cube Triple ScoreVAST
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| VASTLearning Paradigm=Stitching2026.06 | 36 | 2 | 21 | 5 | 16 | |
| VALUE-FLOWSLearning Paradigm=Generative2026.06 | 13 | 0 | 12 | 3 | 7 | |
| QCLearning Paradigm=Chunking2026.06 | 4 | 0 | 20 | 4 | 7 | |
| FLOQLearning Paradigm=Generative2026.06 | 4 | 0 | 13 | 3 | 5 | |
| FQLLearning Paradigm=1-step TD2026.06 | 1 | 0 | 15 | 4 | 5 | |
| IFQLLearning Paradigm=1-step TD2026.06 | 1 | 0 | 16 | 0 | 4 | |
| FQL-nLearning Paradigm=n-step TD2026.06 | 0 | 0 | 18 | 4 | 6 | |
| IFQL-nLearning Paradigm=n-step TD2026.06 | 0 | 0 | 14 | 3 | 4 |