Ranking Relevance on Xiaohongshu Search LONGTAIL
90.042-ACCProcessRL-Reasoning
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ProcessRL-ReasoningData=150k+50k2025.11 | 90.04 | 77.72 | 66.39 | 76.77 | — | — | |
| PPO-ReasoningData=150k+50k2025.11 | 89.7 | 74.96 | 63.74 | 75.4 | — | — | |
| OutcomeRL-ReasoningData=150k+50k2025.11 | 89.62 | 77.03 | 65.08 | 75.96 | — | — | |
| SFT-LabelData=200k2025.11 | 89.11 | 77.66 | 63.24 | 76.31 | — | — | |
| SFT-Reasoning-v2Data=500k2025.11 | 81.15 | 63.55 | 50.64 | 63.65 | — | — | |
| Qwen3-32B-Stepwise-GRPOOptimization=Stepwise-GRPO2026.02 | 80.19 | 66.66 | 67.37 | 66.35 | 71.83 | 81.82 | |
| Qwen3-32B-Mode-Balanced-RLOptimization=Mode-Balanced RL2026.02 | 80.13 | 66.49 | 67.23 | 65.84 | 73.43 | 82.62 | |
| Qwen2.5-72B-InstructScoring Strategy=Standard2026.02 | 79.51 | 65.36 | 67.67 | 65.35 | 72.4 | 82.73 | |
| Qwen3-32B-SFT (AFRL)Training Strategy=AFRL2026.02 | 78.64 | 65.03 | 63.34 | 63.71 | 72.06 | 81.59 | |
| Qwen3-32B-GRPOOptimization=GRPO2026.02 | 78.4 | 65.1 | 68.91 | 65.38 | 71.49 | 82.11 | |
| SFT-Reasoning-v1Data=150k2025.11 | 77.5 | 59.22 | 47.45 | 60.34 | — | — |