Story Generation on HANNA
31.62Win HANNA ScoreEvolvR GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| EvolvR GRPOtraining=EvolvR GRPO2025.08 | 31.62 | 64.36 | 3.589 | |
| Qwen2.5-7B-Instruct + Point-RM GRPOtraining=Point-RM GRPO2025.08 | 29.09 | 56.11 | 3.541 | |
| Qwen2.5-7B-Instructstatus=untuned base model2025.08 | 22.49 | — | 3.464 | |
| Qwen2.5-7B-Instruct + SFTtraining=SFT2025.08 | 17.67 | 32.15 | 3.168 |