Document-level Instruction Following on LongBench v2
27.1Median ScorePolicyLong
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PolicyLongEvaluation Stage=Post-SFT, SFT Recipe=LongMagpie, Base Model=Qwen2.5-3B2026.04 | 27.1 | 31.5 | 29.3 | |
| EntropyLongEvaluation Stage=Post-SFT, SFT Recipe=LongMagpie, Base Model=Qwen2.5-3B2026.04 | 24.2 | 28.7 | 26.5 | |
| Qwen2.5-3BEvaluation Stage=Post-SFT, SFT Recipe=LongMagpie, Base Model=Qwen2.5-3B2026.04 | 23.8 | 29.6 | 26.7 | |
| NExtLongEvaluation Stage=Post-SFT, SFT Recipe=LongMagpie, Base Model=Qwen2.5-3B2026.04 | 23.7 | 26.9 | 25.3 |