Summarization on ACLSum
67.2RewardShapE-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ShapE-GRPObackbone=QWEN3-8B2026.03 | 67.2 | — | |
| GRPObackbone=QWEN3-8B2026.03 | 65.8 | — | |
| QWEN3-8Bstatus=pretrained2026.03 | 65.4 | — | |
| WTAbackbone=QWEN3-8B2026.03 | 64.2 | — | |
| GRPOBackbone=LLAMA 3.1-8B-INSTRUCT, Training Algorithm=GRPO2026.03 | — | 70.7 | |
| LLAMA 3.1-8B-INSTRUCTBackbone=LLAMA 3.1-8B-INSTRUCT, Training Algorithm=Pretrained2026.03 | — | 66.4 | |
| ShapE-GRPOBackbone=LLAMA 3.1-8B-INSTRUCT, Training Algorithm=ShapE-GRPO2026.03 | — | 78 |