Long-context Understanding on LongBench Short v2
61.66Average Score @4 (Short Context)Regular
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RegularBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 61.66 | — | 72.47 | |
| Eagle-2Backbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 61.24 | — | 71.35 | |
| RegularBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 59.69 | — | 73.6 | |
| Eagle-2Backbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 58.29 | — | 71.35 | |
| PIPO-SFT + OPDBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 56.46 | — | 72.47 | |
| PIPO-SFTBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 54.35 | — | 74.16 | |
| MTPBackbone=Qwen3.5-9B, Response Budget=32K-slot2026.05 | 52.81 | — | 71.91 | |
| MTPBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 52.67 | — | 69.1 | |
| PIPO-SFT + OPDBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 49.86 | — | 70.22 | |
| PIPO-SFTBackbone=Qwen3.5-4B, Response Budget=32K-slot2026.05 | 49.02 | — | 71.91 | |
| EntropyLongBackbone=Qwen2.5-3B, Evaluation Stage=After SFT2026.04 | — | 40 | — | |
| NExtLongBackbone=Qwen2.5-3B, Evaluation Stage=After SFT2026.04 | — | 40.6 | — | |
| PolicyLongBackbone=Qwen2.5-3B, Evaluation Stage=After SFT2026.04 | — | 40.6 | — | |
| Qwen2.5-3BEvaluation Stage=After SFT2026.04 | — | 33.9 | — |