Mathematical Reasoning on GSM-Infinite 16K
16.2AccuracyOurs + MInference
Evaluation Results
| Method | Links | |
|---|---|---|
| Ours + MInferenceBackbone Model=Qwen2.5-7B-Inst2025.07 | 16.2 | |
| XAttentionBackbone Model=Qwen2.5-7B-Inst2025.07 | 15.9 | |
| MInferenceBackbone Model=Qwen2.5-7B-Inst2025.07 | 15.5 | |
| TriangleMixBackbone Model=Qwen2.5-7B-Inst2025.07 | 14.9 | |
| Qwen2.5-7B-InstBackbone Model=Qwen2.5-7B-Inst2025.07 | 14.6 | |
| FlexPrefillBackbone Model=Qwen2.5-7B-Inst2025.07 | 14.5 | |
| Ours + XAttentionBackbone Model=Qwen2.5-7B-Inst2025.07 | 14.4 | |
| Ours + FlexPrefillBackbone Model=Qwen2.5-7B-Inst2025.07 | 13.8 | |
| FlexPrefillBackbone Model=Llama-3.1-8B-Inst2025.07 | 11.2 | |
| FlexPrefillBackbone Model=Llama-3-8B-Inst-262k2025.07 | 8.7 | |
| Ours + XAttentionBackbone Model=Llama-3.1-8B-Inst2025.07 | 6.8 | |
| XAttentionBackbone Model=Llama-3-8B-Inst-262k2025.07 | 6.8 | |
| XAttentionBackbone Model=Llama-3.1-8B-Inst2025.07 | 6.7 | |
| TriangleMixBackbone Model=Llama-3-8B-Inst-262k2025.07 | 6.7 | |
| Ours + XAttentionBackbone Model=Llama-3-8B-Inst-262k2025.07 | 6.6 | |
| Llama-3.1-8B-InstBackbone Model=Llama-3.1-8B-Inst2025.07 | 6.4 | |
| Llama-3-8B-Inst-262kBackbone Model=Llama-3-8B-Inst-262k2025.07 | 6.4 | |
| MInferenceBackbone Model=Llama-3-8B-Inst-262k2025.07 | 6.3 | |
| Ours + MInferenceBackbone Model=Llama-3-8B-Inst-262k2025.07 | 6.1 | |
| Ours + FlexPrefillBackbone Model=Llama-3-8B-Inst-262k2025.07 | 6.1 | |
| TriangleMixBackbone Model=Llama-3.1-8B-Inst2025.07 | 5.8 | |
| MInferenceBackbone Model=Llama-3.1-8B-Inst2025.07 | 5.8 | |
| Ours + MInferenceBackbone Model=Llama-3.1-8B-Inst2025.07 | 5.3 | |
| Ours + FlexPrefillBackbone Model=Llama-3.1-8B-Inst2025.07 | 5.3 |