Reinforcement Learning on FailureBench Fragile Push Wall
3,220.12Avg ReturnFARL
Evaluation Results
| Method | Links | |
|---|---|---|
| FARLmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 3,220.12 | |
| PPO-Lagmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 268.83 | |
| P3Omode=fine-tuning, initialization=offline pre-trained policy2026.01 | -278.62 | |
| CPOmode=fine-tuning, initialization=offline pre-trained policy2026.01 | -994.55 |