Story Generation on HANNA 1.0 (test)
3.59Overall ScoreEvolvR GRPO
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| EvolvR GRPOBackbone=Qwen2.5-7B, Training Method=EvolvR GRPO, Evaluation Protocol=Human Evaluation2025.08 | 3.59 | 4.588 | 4.25 | 2.763 | 2.962 | 3.25 | 3.725 | — | |
| Qwen2.5-7B-Instruct + Point-RM GRPOBackbone=Qwen2.5-7B, Training Method=Point-RM GRPO, Evaluation Protocol=Human Evaluation2025.08 | 3.542 | 4.487 | 4.263 | 2.837 | 2.95 | 3.087 | 3.625 | — | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B, Training Method=Instruction Tuning, Evaluation Protocol=Human Evaluation2025.08 | 3.465 | 4.4 | 4.338 | 2.638 | 2.737 | 3.1 | 3.575 | — | |
| Qwen2.5-7B-Instruct + SFTBackbone=Qwen2.5-7B, Training Method=SFT, Evaluation Protocol=Human Evaluation2025.08 | 3.169 | 3.487 | 3.612 | 2.7 | 2.825 | 3.1 | 3.288 | — |