Re-ranking on Amazon Beauty
29.6Recall@1AR GR2 (reference)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AR GR2 (reference)Backbone=Qwen3-8B, Decoding strategy=quality-preserving decoding2026.07 | 29.6 | 56.51 | 44.97 | |
| Diffusion-GR2 +CFT +OPD→ RLBackbone=Qwen3-8B, Decoding strategy=quality-preserving decoding, Training protocol=CFT + OPD + Reinforcement Learning (RL)2026.07 | 29.51 | 56.71 | 45.17 | |
| Diffusion-GR2 +CFT +OPDBackbone=Qwen3-8B, Decoding strategy=quality-preserving decoding, Training protocol=CFT + On-policy distillation (OPD)2026.07 | 29.44 | 56.58 | 44.97 | |
| Diffusion-GR2 +CFTBackbone=Qwen3-8B, Decoding strategy=quality-preserving decoding, Training protocol=Conversion fine-tuning (CFT)2026.07 | 29.3 | 56.51 | 44.97 | |
| Pre-rank floor (retriever)Backbone=Qwen3-8B, Decoding strategy=quality-preserving decoding2026.07 | 28.11 | 55.91 | 44.01 | |
| Diffusion-GR2, naive (no CFT)Backbone=Qwen3-8B, Decoding strategy=quality-preserving decoding, Training protocol=naive (no CFT)2026.07 | 28.11 | 55.91 | 44.01 |