Reinforcement Learning on FailureBench Bounded Soccer
2,276.53Avg ReturnFARL
Evaluation Results
| Method | Links | |
|---|---|---|
| FARLmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 2,276.53 | |
| CPOmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 692.9 | |
| P3Omode=fine-tuning, initialization=offline pre-trained policy2026.01 | 598.55 | |
| PPO-Lagmode=fine-tuning, initialization=offline pre-trained policy2026.01 | 404.8 |