Sparse-reward manipulation on Mug Cleanup simulated environment
90Success RateCSIL++ Ens.
Evaluation Results
| Method | Links | |
|---|---|---|
| CSIL++ Ens.Policy architecture=Ensemble, Learning step=100k2026.06 | 90 | |
| CSIL++ Res.Policy architecture=Residual, Learning step=0k2026.06 | 72 | |
| XQC+OD Res.Policy architecture=Residual, Learning step=0k2026.06 | 72 | |
| VLA2026.06 | 68 | |
| XQC+OD Ens.Policy architecture=Ensemble, Learning step=0k2026.06 | 68 | |
| PLD RL (Res.)Policy architecture=Residual, Learning step=100k2026.06 | 46 |