Mathematical Reasoning on MATH 500 (Mean@1)
0.992Mean@1FlashMLA
Evaluation Results
| Method | Links | |
|---|---|---|
| FlashMLABackbone=LongCat-Flash-thinking, Precision=BF162026.02 | 0.992 | |
| FlashMLABackbone=DeepSeek-V3.1, Precision=BF162026.02 | 0.988 | |
| SnapMLABackbone=LongCat-Flash-thinking, Precision=FP82026.02 | 0.988 | |
| SnapMLABackbone=DeepSeek-V3.1, Precision=FP82026.02 | 0.982 | |
| R1-Distill-Qwen-7B-R-TAP2026.03 | 0.927 | |
| CyclicReflexBackbone=Qwen3-14B, Decoding Strategy=CyclicReflex2025.06 | 0.9 | |
| R1-Distill-Qwen-7B @ 8kTraining iterations=8k2026.03 | 0.881 | |
| OriginalBackbone=Qwen3-14B, Decoding Strategy=Original2025.06 | 0.88 | |
| TIPBackbone=Qwen3-14B, Decoding Strategy=TIP2025.06 | 0.88 | |
| Oat-Zero-7B-R-TAP2026.03 | 0.872 | |
| CyclicReflexBackbone=Qwen3-8B, Decoding Strategy=CyclicReflex2025.06 | 0.86 | |
| TIPBackbone=Qwen3-8B, Decoding Strategy=TIP2025.06 | 0.84 | |
| PRIME-Zero-7B2026.03 | 0.838 | |
| Qwen2.5-Math-7B-Instruct2026.03 | 0.836 | |
| R1-Distill-Qwen-1.5B-R-TAP @ 8kTraining iterations=8k2026.03 | 0.835 | |
| OriginalBackbone=Qwen3-8B, Decoding Strategy=Original2025.06 | 0.83 | |
| OpenReasoner-Zero-7B @ 8kTraining iterations=8k2026.03 | 0.824 | |
| DiSCTTModel=Qwen-2.5-7B-Instruct2026.03 | 0.822 | |
| Oat-Zero-1.5B-R-TAP2026.03 | 0.8 | |
| Oat-Zero-7B2026.03 | 0.8 | |
| OpenReasoner-Zero-7B @ 3kTraining iterations=3k2026.03 | 0.792 | |
| SimpleRL-Zero-7B2026.03 | 0.782 | |
| R1-Distill-Qwen-1.5B @ 8kTraining iterations=8k2026.03 | 0.774 | |
| DiSCTTModel=Qwen-3-4B-Base2026.03 | 0.752 | |
| Qwen2.5-Math-1.5B-Instruct2026.03 | 0.742 | |
| Oat-Zero-1.5B2026.03 | 0.742 | |
| TTRLModel=Qwen-2.5-7B-Instruct2026.03 | 0.742 | |
| EVOL-RLModel=Qwen-2.5-7B-Instruct2026.03 | 0.734 | |
| Qwen2.5-Math-7B2026.03 | 0.69 | |
| CyclicReflexBackbone=Qwen3-4B, Decoding Strategy=CyclicReflex2025.06 | 0.68 | |
| DiSCTTModel=Qwen-3-1.7B-Base2026.03 | 0.67 | |
| EVOL-RLModel=Qwen-3-4B-Base2026.03 | 0.646 | |
| TIPBackbone=Qwen3-4B, Decoding Strategy=TIP2025.06 | 0.63 | |
| Qwen2.5-Math-1.5B2026.03 | 0.618 | |
| TTRLModel=Qwen-3-4B-Base2026.03 | 0.606 | |
| R1-Distill-Qwen-7B @ 3kTraining iterations=3k2026.03 | 0.601 | |
| OriginalBackbone=Qwen3-4B, Decoding Strategy=Original2025.06 | 0.6 | |
| BaseModel=Qwen-2.5-7B-Instruct2026.03 | 0.588 | |
| DiSCTTModel=LLaMA-3.2-3B-Instruct2026.03 | 0.556 | |
| TTRLModel=Qwen-3-1.7B-Base2026.03 | 0.552 | |
| EVOL-RLModel=Qwen-3-1.7B-Base2026.03 | 0.538 | |
| R1-Distill-Qwen-1.5B @ 3kTraining iterations=3k2026.03 | 0.522 | |
| BaseModel=Qwen-3-4B-Base2026.03 | 0.514 | |
| DiSCTTModel=Qwen-2.5-0.5B-Instruct2026.03 | 0.498 | |
| EVOL-RLModel=LLaMA-3.2-3B-Instruct2026.03 | 0.472 | |
| BaseModel=Qwen-3-1.7B-Base2026.03 | 0.47 | |
| TTRLModel=LLaMA-3.2-3B-Instruct2026.03 | 0.454 | |
| EVOL-RLModel=Qwen-2.5-0.5B-Instruct2026.03 | 0.4 | |
| DiSCTTModel=LLaMA-3.2-1B-Instruct2026.03 | 0.396 | |
| TTRLModel=Qwen-2.5-0.5B-Instruct2026.03 | 0.372 | |
| BaseModel=LLaMA-3.2-3B-Instruct2026.03 | 0.357 | |
| EVOL-RLModel=LLaMA-3.2-1B-Instruct2026.03 | 0.312 | |
| TTRLModel=LLaMA-3.2-1B-Instruct2026.03 | 0.28 | |
| BaseModel=Qwen-2.5-0.5B-Instruct2026.03 | 0.276 | |
| BaseModel=LLaMA-3.2-1B-Instruct2026.03 | 0.14 |