Language Generation on Synthetic Data (test)
62.67ROUGE-1P-GRPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| P-GRPOModel=Qwen3-8B2026.02 | 62.67 | 18.53 | 37.58 | 0.615 | |
| P-GRPOBackbone=Qwen3-8B2026.02 | 62.67 | 18.53 | 37.58 | 0.615 | |
| P-GRPOModel=Gemma-2B2026.02 | 61.33 | 18.61 | 37.98 | 0.7154 | |
| P-GRPOBackbone=Gemma-2B2026.02 | 61.33 | 18.61 | 37.98 | 0.7154 | |
| GRPOModel=Qwen3-8B2026.02 | 60.75 | 17.13 | 36.24 | 0.5814 | |
| GRPOBackbone=Qwen3-8B2026.02 | 60.75 | 17.13 | 36.24 | 0.5814 | |
| GRPOModel=Gemma-2B2026.02 | 60.42 | 17.75 | 37.06 | 0.709 | |
| GRPOBackbone=Gemma-2B2026.02 | 60.42 | 17.75 | 37.06 | 0.709 | |
| GDPOModel=Qwen3-8B2026.02 | 56.63 | 13.74 | 33.59 | 0.5246 | |
| GDPOBackbone=Qwen3-8B2026.02 | 56.63 | 13.74 | 33.59 | 0.5246 | |
| GDPOModel=Gemma-2B2026.02 | 52.97 | 13.29 | 29.07 | 0.705 | |
| GDPOBackbone=Gemma-2B2026.02 | 52.97 | 13.29 | 29.07 | 0.705 |