Robot Policy Execution on RL4VLA Pepper fixed-object
89.6Success Rateπ0 + Qwen3.5
Evaluation Results
| Method | Links | |
|---|---|---|
| π0 + Qwen3.5Base Action Policy=π0, Language-Conditioning Optimization Method=Qwen3.52026.07 | 89.6 | |
| π0 + GEPABase Action Policy=π0, Language-Conditioning Optimization Method=GEPA2026.07 | 61.7 | |
| π0 + TextGradBase Action Policy=π0, Language-Conditioning Optimization Method=TextGrad2026.07 | 44.3 | |
| π0 origBase Action Policy=π0, Language-Conditioning Optimization Method=None2026.07 | 39.1 |