Math Reasoning on AIME 25 (Accuracy)
76.7AIME 25 AccuracyBaseline
Evaluation Results
| Method | Links | |
|---|---|---|
| BaselineBackbone=Qwen3-MoE-30B-A3B, Type=–2026.06 | 76.7 | |
| OursQBackbone=Qwen3-MoE-30B-A3B, Sparsity=25%, Quantization=4-bit2026.06 | 75 | |
| BaselineSparsity=0%2025.11 | 72.9 | |
| OursBackbone=Qwen3-MoE-30B-A3B, Sparsity=50%2026.06 | 64 | |
| PuzzleMoESparsity=25%2025.11 | 61.5 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 51.4 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 49.1 | |
| DAPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=DAPO2025.09 | 48.7 | |
| GRPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=GRPO2025.09 | 40.3 | |
| DS-R1-Distill-Qwen-7BBase Model=DS-R1-Distill-Qwen-7B2025.09 | 39.1 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 33.9 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 31 | |
| DAPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=DAPO2025.09 | 28.4 | |
| GRPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=GRPO2025.09 | 28.1 | |
| DS-R1-Distill-Qwen-1.5BBase Model=DS-R1-Distill-Qwen-1.5B2025.09 | 24.1 | |
| HC-SMoESparsity=25%2025.11 | 0 |