Long-context understanding on InfiniteBench
0.5Math Score (F)SinkRouter
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SinkRouterModel=LLaMA-3.1-8B2026.04 | 0.5 | 0.68 | 0.2743 | 0.19 | 0.568 | — | — | 0.2287 | 0.5347 | — | — | — | 1 | 0.9949 | 0.3766 | 0.0004 | |
| Full AttentionModel=LLaMA-3.1-8B2026.04 | 0.495 | 0.685 | 0.2852 | 0.19 | 0.546 | — | — | 0.2352 | 0.5343 | — | — | — | 1 | 0.9949 | 0.3774 | — | |
| MinferenceBackbone=Qwen2.5-7B-Instruct-1M2025.09 | 0.4771 | — | — | — | — | — | — | 0.302 | 0.3791 | 0.3012 | 0.1516 | 0.7853 | — | — | — | — | |
| XAttentionBackbone=Qwen2.5-7B-Instruct-1M2025.09 | 0.4371 | — | — | — | — | — | — | 0.3274 | 0.3726 | 0.2963 | 0.1556 | 0.704 | — | — | — | — | |
| FlexPrefillBackbone=Qwen2.5-7B-Instruct-1M2025.09 | 0.4229 | — | — | — | — | — | — | 0.3096 | 0.3739 | 0.3142 | 0.1566 | 0.7507 | — | — | — | — | |
| ProxyAttnBackbone=Qwen2.5-7B-Instruct-1M2025.09 | 0.4171 | — | — | — | — | — | — | 0.3299 | 0.3833 | 0.2975 | 0.1536 | 0.776 | — | — | — | — | |
| FullAttentionBackbone=Qwen2.5-7B-Instruct-1M2025.09 | 0.4114 | — | — | — | — | — | — | 0.3198 | 0.3822 | 0.3057 | 0.1565 | 0.7787 | — | — | — | — | |
| MinferenceBackbone=Llama3.1-8B-Instruct2025.09 | 0.3571 | — | — | — | — | — | — | 0.264 | 0.3478 | 0.29 | 0.1257 | 0.7359 | — | — | — | — | |
| FastGenModel=LLaMA-3.1-8B2026.04 | 0.345 | 0.69 | 0.272 | 0.17 | 0.405 | — | — | 0.215 | 0.4948 | — | — | — | 0.99 | 0.99 | 0.3766 | -0.0395 | |
| FullAttentionBackbone=Llama3.1-8B-Instruct2025.09 | 0.3343 | — | — | — | — | — | — | 0.2335 | 0.3538 | 0.3209 | 0.1365 | 0.8484 | — | — | — | — | |
| XAttentionBackbone=Llama3.1-8B-Instruct2025.09 | 0.3257 | — | — | — | — | — | — | 0.2284 | 0.3489 | 0.3145 | 0.1328 | 0.8003 | — | — | — | — | |
| FlexPrefillBackbone=Llama3.1-8B-Instruct2025.09 | 0.3229 | — | — | — | — | — | — | 0.236 | 0.3396 | 0.3075 | 0.1369 | 0.8077 | — | — | — | — | |
| ProxyAttnBackbone=Llama3.1-8B-Instruct2025.09 | 0.32 | — | — | — | — | — | — | 0.2513 | 0.3606 | 0.3321 | 0.1335 | 0.8149 | — | — | — | — | |
| Token Sparse AttentionBackbone=LLaMA-3.1-8B-Instruct, Baseline=Flash-Attention2026.02 | 0.2571 | 0.6507 | 0.2801 | 0.17 | 0.55 | 0.9847 | 0.9746 | 0.203 | 0.5088 | — | — | — | — | — | — | — | |
| Flash-AttentionBackbone=LLaMA-3.1-8B-Instruct2026.02 | 0.24 | 0.6419 | 0.2764 | 0.19 | 0.552 | 0.9847 | 0.978 | 0.2056 | 0.5086 | — | — | — | — | — | — | — | |
| Token Sparse AttentionBackbone=LLaMA-3.1-8B-Instruct, Baseline=FlexPrefill2026.02 | 0.2286 | 0.6725 | 0.276 | 0.14 | 0.468 | 0.9898 | 0.9627 | 0.2005 | 0.4923 | — | — | — | — | — | — | — | |
| FlexPrefillBackbone=LLaMA-3.1-8B-Instruct2026.02 | 0.2257 | 0.6812 | 0.2737 | 0.11 | 0.508 | 0.9915 | 0.9695 | 0.203 | 0.4953 | — | — | — | — | — | — | — | |
| MinferenceBackbone=LLaMA-3.1-8B-Instruct2026.02 | 0.2229 | 0.6725 | 0.268 | 0.185 | 0.516 | 0.9746 | 0.978 | 0.1954 | 0.5016 | — | — | — | — | — | — | — | |
| Token Sparse AttentionBackbone=LLaMA-3.1-8B-Instruct, Baseline=Minference2026.02 | 0.2143 | 0.6594 | 0.2761 | 0.185 | 0.496 | 0.9746 | 0.978 | 0.1929 | 0.497 | — | — | — | — | — | — | — | |
| MinferenceBackbone=Mistral-Nemo-12B-Instruct2026.02 | 0.06 | 0.3799 | 0.1676 | 0.055 | 0 | 0.3458 | 0.3119 | 0.2614 | 0.1977 | — | — | — | — | — | — | — | |
| Token Sparse AttentionBackbone=Mistral-Nemo-12B-Instruct, Baseline=Minference2026.02 | 0.0514 | 0.3843 | 0.163 | 0.055 | 0 | 0.3373 | 0.3 | 0.2614 | 0.1941 | — | — | — | — | — | — | — | |
| FlexPrefillBackbone=Mistral-Nemo-12B-Instruct2026.02 | 0.0457 | 0.3581 | 0.1745 | 0.07 | 0 | 0.4119 | 0.6576 | 0.2665 | 0.248 | — | — | — | — | — | — | — | |
| Token Sparse AttentionBackbone=Mistral-Nemo-12B-Instruct, Baseline=FlexPrefill2026.02 | 0.0314 | 0.3537 | 0.1671 | 0.065 | 0 | 0.3932 | 0.6593 | 0.2563 | 0.2408 | — | — | — | — | — | — | — | |
| Flash-AttentionBackbone=Mistral-Nemo-12B-Instruct2026.02 | 0.0143 | 0.3319 | 0.1687 | 0.055 | 0 | 0.3661 | 0.6271 | 0.2716 | 0.2293 | — | — | — | — | — | — | — | |
| Token Sparse AttentionBackbone=Mistral-Nemo-12B-Instruct, Baseline=Flash-Attention2026.02 | 0.0086 | 0.3319 | 0.1681 | 0.055 | 0 | 0.3576 | 0.6288 | 0.2741 | 0.228 | — | — | — | — | — | — | — |