Multimodal Policy Fine-Tuning on Gaussian-mixture environment (G1 landscape)
100Success Rate (SR)DSRL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DSRLFine-tuning variant=Standard2026.05 | 100 | 25 | 0.25 | 0 | |
| DPPOFine-tuning variant=Standard2026.05 | 100 | 58 | 0.5825 | 0.4 | |
| RESFine-tuning variant=BMD2026.05 | 100 | 100 | 1 | 0.99 | |
| DPPOFine-tuning variant=BMD2026.05 | 100 | 100 | 1 | 0.99 | |
| RESFine-tuning variant=Standard2026.05 | 98 | 98 | 1 | 1 | |
| DPPO [10]Fine-tuning variant=Standard2026.05 | 66 | 16 | 0.0825 | 0 | |
| DSRLFine-tuning variant=BMD2026.05 | 33 | 33 | 0.3325 | 0.46 |