Personalized Trajectory Selection on Privacy Preference Dataset (test)
70.31SR (P-f)DPO
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| DPOBackbone=Qwen2.5VL-3B, Optimization Objective=DPO2026.04 | 70.31 | 60.37 | 65.34 | 28.2 | 46.67 | 14.81 | 35.67 | 31.94 | 30.74 | 59.26 | |
| SFTBackbone=Qwen2.5VL-3B, Optimization Objective=Supervised Fine-Tuning2026.04 | 70.21 | 60.13 | 65.17 | 35.6 | 32.38 | 37.04 | 38.12 | 36.86 | 34.71 | 59.26 | |
| IPOBackbone=Qwen2.5VL-3B, Optimization Objective=IPO2026.04 | 70.04 | 60.84 | 65.44 | 29.02 | 39.52 | 37.04 | 42.09 | 35.56 | 38.28 | 62.96 | |
| ORPOBackbone=Qwen2.5VL-3B, Optimization Objective=ORPO2026.04 | 69.65 | 61.31 | 65.48 | 17.26 | 46.67 | 54.32 | 43.9 | 30.58 | 50.5 | 48.15 | |
| TIPOBackbone=Qwen2.5VL-3B, Optimization Objective=TIPO2026.04 | 69.08 | 62.11 | 65.6 | 42.85 | 15.71 | 29.63 | 49.59 | 46.22 | 22.67 | 66.67 | |
| CPOBackbone=Qwen2.5VL-3B, Optimization Objective=CPO2026.04 | 68.63 | 61.36 | 65 | 19.73 | 39.52 | 61.73 | 48.82 | 34.28 | 50.63 | 48.15 | |
| SimPOBackbone=Qwen2.5VL-3B, Optimization Objective=SimPO2026.04 | 67.6 | 60.62 | 64.11 | 25.07 | 37.14 | 51.85 | 46.69 | 35.88 | 44.5 | 62.96 | |
| FrozenBackbone=Qwen2.5VL-3B2026.04 | 44.08 | 34.5 | 39.29 | 16.13 | 78.57 | 88.89 | 65.31 | 40.72 | 83.73 | 48.15 |