Long-context reasoning on InfiniteBench (test)
50.18Average ScoreQwen3-8B-SFT w/ LongR
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Qwen3-8B-SFT w/ LongRBackbone=Qwen3-8B, Training Strategy=SFT w/ LongR2026.02 | 50.18 | 87.44 | 89.76 | 15.72 | 27.4 | 22.31 | 58.45 | |
| Qwen3-8B-SFT w/ DAPOBackbone=Qwen3-8B, Training Strategy=SFT w/ DAPO2026.02 | 48.11 | 85.93 | 83.56 | 11.86 | 27.45 | 23.54 | 56.33 | |
| Qwen3-4B-SFT w/ LongRBackbone=Qwen3-4B, Training Strategy=SFT w/ LongR2026.02 | 47.6 | 86.93 | 87.05 | 16.07 | 21.85 | 17.39 | 56.29 | |
| Qwen3-8B-SFTBackbone=Qwen3-8B, Training Strategy=SFT2026.02 | 46.68 | 85.76 | 86.44 | 14.18 | 25.09 | 14.47 | 54.15 | |
| FullKVBase Model=LLaMA-3.1-8B-Instruct, KV Cache Budget (B_total)=1024L2026.05 | 45.38 | — | — | — | — | — | — | |
| Qwen3-4B-SFT w/ DAPOBackbone=Qwen3-4B, Training Strategy=SFT w/ DAPO2026.02 | 44.99 | 87.63 | 84.75 | 17.78 | 14.83 | 10.39 | 54.59 | |
| Qwen3-4B-SFTBackbone=Qwen3-4B, Training Strategy=SFT2026.02 | 43.1 | 86.78 | 83.44 | 12.76 | 12.68 | 9.65 | 53.28 | |
| RDKVBase Model=LLaMA-3.1-8B-Instruct, KV Cache Budget (B_total)=1024L2026.05 | 39.46 | — | — | — | — | — | — | |
| AdaKVBase Model=LLaMA-3.1-8B-Instruct, KV Cache Budget (B_total)=1024L2026.05 | 38.06 | — | — | — | — | — | — | |
| SnapKVBase Model=LLaMA-3.1-8B-Instruct, KV Cache Budget (B_total)=1024L2026.05 | 37.91 | — | — | — | — | — | — | |
| Snap+ZipBase Model=LLaMA-3.1-8B-Instruct, KV Cache Budget (B_total)=1024L2026.05 | 37.76 | — | — | — | — | — | — | |
| ThinKBase Model=LLaMA-3.1-8B-Instruct, KV Cache Budget (B_total)=1024L2026.05 | 36.73 | — | — | — | — | — | — |