Mathematical Reasoning on GSM8K (Pass Rate)
96Pass RateGEM
Evaluation Results
| Method | Links | |
|---|---|---|
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 96 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 96 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 95.3 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 95.2 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 94.9 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 94.5 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 87.7 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 87.7 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 87.4 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 86.8 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 85.1 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 84 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 83.5 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 81 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 78.6 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 69.9 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 61.2 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 60.7 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 60.1 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 59.2 |