Mathematical Reasoning on AIME25 (Pass@8, Pass@16, Pass@32)
40Pass@8SENT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SENTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 40 | 43.33 | 46.67 | |
| w/ CovBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 36.67 | 36.67 | 40 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.33 | 40 | 43.33 | |
| w/ EnBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.33 | 36.67 | 43.3 | |
| w/ AdvBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.33 | 30 | 36.67 | |
| w/ MaskBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.33 | 33.33 | 43.33 | |
| w/ ClipBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.33 | 40 | 36.67 | |
| w/ High EnBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 33.33 | 33.33 | 40 | |
| Base modelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 26.67 | 33.33 | 30 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 18.8 | — | — | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 18.3 | — | — | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 17.5 | — | — | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 16.7 | — | — | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 16.7 | — | — | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 16.2 | — | — | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 14.2 | — | — | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 12.1 | — | — | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 11.7 | — | — | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 9.2 | — | — | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 1.2 | — | — | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 1.2 | — | — | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 1.2 | — | — | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 1.2 | — | — | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 1.2 | — | — | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 1.1 | — | — | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 0.8 | — | — | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 0.6 | — | — | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 0.4 | — | — | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 0 | — | — |