Online Reinforcement Learning on CLEVR-Robot
19.4RewardLaGO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LaGOTask=Hard2026.06 | 19.4 | 14 | |
| LaGOTask=Easy2026.06 | 14.8 | 14.8 | |
| Vanilla PPOTask=Easy2026.06 | 13.8 | 13.8 | |
| LaGOTask=Overall Average2026.06 | 12.2 | 27.2 | |
| Vanilla PPOTask=Hard2026.06 | 10.6 | 0.7 | |
| LaGOTask=Real2026.06 | 7.8 | 41.3 | |
| Vanilla PPOTask=Overall Average2026.06 | 7.6 | 15.1 | |
| LaGOTask=Rephrase2026.06 | 6.9 | 38.8 | |
| Vanilla PPOTask=Real2026.06 | 3 | 23 | |
| Vanilla PPOTask=Rephrase2026.06 | 3 | 23 |