Offline Reinforcement Learning on D4RL MuJoCo v2 (Ant, Hopper, HalfCheetah, Walker2D)
31.62Ant Return (Random)Preference Flow Matching (PFM)
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Preference Flow Matching (PFM)Seeds=52024.05 | 31.62 | 96.73 | 132.2 | 7.69 | 58.76 | 111.7 | 2.26 | 43.49 | 90.05 | 1.77 | 72.59 | 108.36 | 10.84 | 67.89 | 110.58 | 63.1 | |
| BCSeeds=52024.05 | 31.59 | 90.16 | 125.83 | 3.17 | 52.83 | 111.27 | 2.25 | 40.97 | 91.02 | 1.47 | 60.35 | 108.62 | 9.62 | 61.08 | 109.19 | 59.97 | |
| DPOSeeds=5, Protocol=Fine-tuned2024.05 | 31.52 | 95.04 | 134.96 | 3.23 | 53.47 | 111.51 | 2.26 | 41.94 | 92.15 | 1.38 | 74.05 | 108.38 | 9.6 | 66.13 | 111.75 | 62.49 | |
| Marginal BCSeeds=52024.05 | 25.01 | 99.67 | 99.29 | 5.48 | 40.44 | 32.39 | 2.21 | 38.79 | 4.77 | 2.45 | 65.29 | 15.8 | 8.79 | 61.05 | 38.06 | 35.97 |