Mathematical Reasoning on GAOKAO-en
73Pass RateSED-SFT
Evaluation Results
| Method | Links | |
|---|---|---|
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 73 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 72.5 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 71.4 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 70.6 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 70.6 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 70.1 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 59.7 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 59.5 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 57.7 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 56.6 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 53 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 47.8 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 44.9 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 41 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 41 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 37.1 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 34.5 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 33.8 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 33 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 32.7 |