Summarization on Reddit TL;DR (evaluation)
19.07Total ScoreGDPO+SAW
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GDPO+SAWWeighting=CV-based dynamic advantage weighting, Mode=22026.06 | 19.07 | 9.35 | 9.72 | |
| GDPO+GradientWeighting=Gradient-based dynamic advantage weighting2026.06 | 18.94 | 9.17 | 9.77 | |
| GRPO+SAWWeighting=CV-based dynamic reward weighting, Mode=12026.06 | 18.8 | 9.15 | 9.65 | |
| GDPOWeighting=Equal-weight advantage summation2026.06 | 18.8 | 9.1 | 9.7 | |
| GRPO+GradientWeighting=Gradient-based dynamic reward weighting2026.06 | 18.76 | 9.11 | 9.64 | |
| GRPOWeighting=Equal-weight reward summation2026.06 | 18.2 | 8.71 | 9.49 | |
| Qwen2.5-1.5B-InstructModel type=Base pre-trained model2026.06 | 14.69 | 7.34 | 7.35 |