Generative Search Policy Evaluation on RedNote Search (test)
99.59Query Quality ScoreGRPO-Gated
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GRPO-GatedOptimization Strategy=Group Relative Policy Optimization with Gated Aggregation2026.03 | 99.59 | 70.89 | 98.75 | 98.36 | 99.25 | 98.32 | 90.99 | |
| RFTOptimization Strategy=Rejection Fine-Tuning2026.03 | 97.2 | 58.8 | 99.3 | 92.6 | 98.9 | 96 | 89.5 | |
| GRPO-LinearOptimization Strategy=Group Relative Policy Optimization with Weighted Sum Aggregation2026.03 | 96.36 | 58.61 | 99.06 | 97.14 | 97.3 | 97.38 | 86.04 | |
| GRPO-GenRMOptimization Strategy=Group Relative Policy Optimization with Generative Reward Model2026.03 | 96.3 | 59.8 | 98.7 | 93.4 | 96.7 | 98.4 | 84.5 | |
| DPOOptimization Strategy=Direct Preference Optimization2026.03 | 95.4 | 61.2 | 98.85 | 95.1 | 97.45 | 96.9 | 86.1 | |
| SFTOptimization Strategy=Supervised Fine-Tuning2026.03 | 91.67 | 58.09 | 96.75 | 91.76 | 96.97 | 92.22 | 79.39 |