Math Reasoning on AIME24
76.7AccuracyDiffMAS
Evaluation Results
| Method | Links | |
|---|---|---|
| DiffMASBackbone=Qwen3-14B2026.04 | 76.7 | |
| DiffMASBackbone=Mistral3-8B2026.04 | 73.3 | |
| DiffMASBackbone=DeepSeek-R1-Distill-Qwen-32B2026.04 | 70 | |
| LatentMASBackbone=Qwen3-14B2026.04 | 66.7 | |
| SingleBackbone=DeepSeek-R1-Distill-Qwen-32B2026.04 | 66.7 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 66 | |
| SingleBackbone=Qwen3-14B2026.04 | 63.3 | |
| TextMASBackbone=Qwen3-14B2026.04 | 63.3 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 62.3 | |
| DAPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=DAPO2025.09 | 59.7 | |
| GRPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=GRPO2025.09 | 55.3 | |
| DS-R1-Distill-Qwen-7BBase Model=DS-R1-Distill-Qwen-7B2025.09 | 54.5 | |
| SingleBackbone=Mistral3-8B2026.04 | 50 | |
| TextMASBackbone=DeepSeek-R1-Distill-Qwen-32B2026.04 | 50 | |
| LatentMASBackbone=DeepSeek-R1-Distill-Qwen-32B2026.04 | 50 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 43.6 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 42 | |
| DAPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=DAPO2025.09 | 40 | |
| GRPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=GRPO2025.09 | 33.4 | |
| LatentMASBackbone=Mistral3-8B2026.04 | 33.3 | |
| DS-R1-Distill-Qwen-1.5BBase Model=DS-R1-Distill-Qwen-1.5B2025.09 | 29.2 | |
| TextMASBackbone=Mistral3-8B2026.04 | 26.7 |