Long-range retrieval and reasoning on RULER Synthetic retrieval reasoning
71.07Accuracy (64K Context)PolicyLong
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PolicyLongEvaluation Stage=Pre-SFT, Base Model=Qwen2.5-3B2026.04 | 71.07 | 65.99 | 68.53 | |
| NExtLongEvaluation Stage=Pre-SFT, Base Model=Qwen2.5-3B2026.04 | 70.17 | 61.71 | 65.94 | |
| EntropyLongEvaluation Stage=Pre-SFT, Base Model=Qwen2.5-3B2026.04 | 69.86 | 63.45 | 66.66 | |
| Qwen2.5-3BEvaluation Stage=Pre-SFT, Base Model=Qwen2.5-3B2026.04 | 65.36 | 63.22 | 64.29 |