Recommendation on Reddit V2 (test)
13.69Recall@5Mult-DPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mult-DPOMode=DPO-based, Backbone=Qwen2.5-3B-Instruct2026.06 | 13.69 | 14.31 | 15.03 | |
| BigRecMode=SFT-based, Backbone=Qwen2.5-3B-Instruct2026.06 | 12.28 | 12.47 | 13.64 | |
| D3Mode=SFT-based, Backbone=Qwen2.5-3B-Instruct2026.06 | 11.95 | 12.14 | 13.32 | |
| LiPO (BT)Mode=DPO-based, Backbone=Qwen2.5-3B-Instruct2026.06 | 11.47 | 12.34 | 13.29 | |
| Mult-DPOMode=DPO-based, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 10.97 | 11.01 | 11.54 | |
| BigRecMode=SFT-based, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 10.43 | 10.56 | 10.83 | |
| S-DPOMode=DPO-based, Backbone=Qwen2.5-3B-Instruct2026.06 | 10.43 | 11.32 | 12.19 | |
| D3Mode=SFT-based, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 10.15 | 10.37 | 10.64 | |
| DMPOMode=DPO-based, Backbone=Qwen2.5-3B-Instruct2026.06 | 9.81 | 10.09 | 10.32 | |
| LiPO (BT)Mode=DPO-based, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 9.63 | 10.2 | 10.6 | |
| S-DPOMode=DPO-based, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 9.31 | 9.38 | 9.85 | |
| Vanilla DPOMode=DPO-based, Backbone=Qwen2.5-3B-Instruct2026.06 | 9.15 | 9.6 | 9.98 | |
| DMPOMode=DPO-based, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 8.75 | 8.93 | 9.12 | |
| Vanilla DPOMode=DPO-based, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 8.16 | 8.19 | 8.38 | |
| Qwen2.5-3B-InstructMode=zero-shot, Backbone=Qwen2.5-3B-Instruct2026.06 | 6.33 | 6.17 | 6.41 | |
| Qwen2.5-0.5B-InstructMode=zero-shot, Backbone=Qwen2.5-0.5B-Instruct2026.06 | 1.75 | 2.07 | 2.16 |