Offline-to-Online Reinforcement Learning on D4RL Franka Kitchen
46.65Partial Success RateROAD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ROADBackbone=PEX2026.05 | 46.65 | 50.74 | 58.34 | |
| ROADMixing Ratio Strategy=ROAD, Algorithm=IQL2026.05 | 42.65 | 56.62 | 66.25 | |
| Fixed Mixing RatioMixing Ratio=0.2, Backbone=PEX2026.05 | 39.17 | 37.11 | 15.82 | |
| Fixed Mixing RatioMixing Ratio=0.4, Backbone=PEX2026.05 | 33.32 | 50 | 40.85 | |
| Fixed Mixing RatioMixing Ratio=0.1, Backbone=PEX2026.05 | 26.66 | 19.61 | 47.07 | |
| UniformMixing Ratio Strategy=Uniform, Algorithm=IQL2026.05 | 22.04 | 55.83 | 53.75 | |
| Fixed Mixing RatioMixing Ratio=0.5, Backbone=PEX2026.05 | 19.16 | 48.71 | 33.74 | |
| Uniform Mixing StrategyBackbone=PEX2026.05 | 18.8 | 18.1 | 0.62 | |
| Fixed Mixing RatioMixing Ratio=0.3, Backbone=PEX2026.05 | 17.92 | 42.06 | 16.66 | |
| Fixed Mixing RatioMixing Ratio=0.0, Backbone=PEX2026.05 | 15.42 | 0 | 1.25 | |
| BRBackbone=PEX2026.05 | 2.48 | 21.26 | 51.25 | |
| Decreasing Mixing StrategyBackbone=PEX2026.05 | 0 | 42.52 | 34.95 |