Long-context Retrieval and Reasoning on RULER 32k
62.28ScoreQwen3-4B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-4BModel Scale=4B2026.04 | 62.28 | |
| Qwen2.5-3BModel Scale=3B2026.04 | 58.95 | |
| Llama3.2-3BModel Scale=3B2026.04 | 51.38 | |
| SpB2.0-5BModel Scale=5B, Additional Training Tokens=14B2026.04 | 50.87 | |
| Gemma3-4BModel Scale=4B2026.04 | 43.44 |