Reinforcement Learning on FailureBench Obstructed Push
1,227.18Average ReturnFARL
Evaluation Results
| Method | Links | |
|---|---|---|
| FARLmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 1,227.18 | |
| PPO-Lagmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 543.95 | |
| P3Omode=fine-tuning, initialization=offline pre-trained policy2026.01 | 455.86 | |
| CPOmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 47.4 |