Mathematical Reasoning on AIME 25 (Mean@32)
89.58Mean@32FlashMLA
Evaluation Results
| Method | Links | |
|---|---|---|
| FlashMLABackbone=LongCat-Flash-thinking, Precision=BF162026.02 | 89.58 | |
| SnapMLABackbone=LongCat-Flash-thinking, Precision=FP82026.02 | 88.44 | |
| FlashMLABackbone=DeepSeek-V3.1, Precision=BF162026.02 | 87.92 | |
| SnapMLABackbone=DeepSeek-V3.1, Precision=FP82026.02 | 85.42 | |
| SFTBackbone=Qwen2.5-7B-Instruct2025.08 | 23.02 | |
| PSFTwarm-upBackbone=Qwen2.5-7B-Instruct2025.08 | 23.02 | |
| PSFTBackbone=Qwen2.5-7B-Instruct2025.08 | 21.98 | |
| SFT-KLBackbone=Qwen2.5-7B-Instruct2025.08 | 21.56 | |
| PSFTwarm-upBackbone=Llama3.1-8B-Instruct2025.08 | 18.75 | |
| SFTBackbone=Llama3.1-8B-Instruct2025.08 | 16.77 | |
| SFT-KLBackbone=Llama3.1-8B-Instruct2025.08 | 16.15 | |
| GRPO + EntrocraftTraining Samples=400K2026.04 | 15.7 | |
| GRPO + Clip-CovTraining Samples=400K2026.04 | 15 | |
| GRPO + EntrocraftTraining Samples=300K2026.04 | 14.8 | |
| PSFTBackbone=Llama3.1-8B-Instruct2025.08 | 14.48 | |
| GRPO + Clip-CovTraining Samples=300K2026.04 | 14.2 | |
| GRPO + EntrocraftTraining Samples=200K2026.04 | 14.2 | |
| GRPO + Clip-HigherTraining Samples=400K2026.04 | 13.6 | |
| GRPO + EntrocraftTraining Samples=100K2026.04 | 13.1 | |
| GRPO + Clip-HigherTraining Samples=300K2026.04 | 12.8 | |
| GRPO + Clip-CovTraining Samples=200K2026.04 | 12.5 | |
| GRPO + Clip-HigherTraining Samples=200K2026.04 | 12.3 | |
| GRPO + Clip-CovTraining Samples=100K2026.04 | 10.9 | |
| GRPOTraining Samples=200K2026.04 | 10.1 | |
| GRPOTraining Samples=100K2026.04 | 9.9 | |
| GRPOTraining Samples=300K2026.04 | 9.6 | |
| GRPO + Clip-HigherTraining Samples=100K2026.04 | 9.6 | |
| GRPOTraining Samples=400K2026.04 | 9.4 | |
| BaseBackbone=Qwen2.5-7B-Instruct2025.08 | 8.75 | |
| BaseBackbone=Llama3.1-8B-Instruct2025.08 | 0.73 |