Offline-to-online Reinforcement Learning on OGBench
100Success Rate (Cube-Double, Task 2)QC-FQL
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| QC-FQLinference_type=distilled one-step, action_chunking=true2026.05 | 100 | 99.8 | 99.8 | 88.2 | 60.4 | 51.4 | 98 | 85 | 92.2 | |
| DFPinference_type=teacher-free one-step, action_chunking=true2026.05 | 100 | 99.6 | 99.6 | 98.4 | 91.6 | 81.2 | 99.6 | 96.6 | 99 | |
| QC-BFNinference_type=multi-step, action_chunking=true2026.05 | 99.8 | 99.8 | 92.6 | 87.4 | 80.8 | 33.4 | 95.8 | 63.2 | 74.2 | |
| MVPinference_type=teacher-free one-step, action_chunking=true2026.05 | 98.4 | 98.6 | 94.8 | 86.2 | 57.2 | 31 | 96.6 | 47.2 | 91.2 | |
| FQLinference_type=distilled one-step, action_chunking=false2026.05 | 93.2 | 91.2 | 6 | 0.4 | 6.4 | 0 | 0 | 0 | 0 | |
| BFNinference_type=multi-step, action_chunking=false2026.05 | 86 | 88.8 | 27.2 | 7.6 | 6.8 | 0 | 32.4 | 0 | 0 |