Mathematical Reasoning on AMC23 (Pass Rate Avg@8)
67.8Pass Rate (Avg@8)CrossEntropy
Evaluation Results
| Method | Links | |
|---|---|---|
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 67.8 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 67.2 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 66.2 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 63.7 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 61.6 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 58.1 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 46.9 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 42.2 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 40 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 38.4 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 35.3 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 33.4 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 31.5 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 27.3 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 26.6 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 17.2 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 16.6 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 16.2 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 12.8 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 10.3 |