Reinforcement Learning on FailureBench Bounded Push
4,593.96Average ReturnFARL
Evaluation Results
| Method | Links | |
|---|---|---|
| FARLmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 4,593.96 | |
| PPO-Lagmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 420.79 | |
| CPOmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 156.28 | |
| P3Omode=fine-tuning, initialization=offline pre-trained policy2026.01 | 95.33 |