Reasoning on AIME 2024 (Pass@1, Cons@6, Cons@32)
64.22Pass@1SSFT-32B-GFPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SSFT-32B-GFPOTraining data type=multi-target data2025.10 | 64.22 | 76.67 | 83.33 | |
| SSFT-32BTraining data type=multi-target data2025.10 | 64.06 | 75.45 | 83.33 | |
| SSFT-32B (random σ)Training data type=multi-target data2025.10 | 61.77 | 73.03 | 80 | |
| SFT-mixed-distill-32B-tagsTraining data type=multi-target data2025.10 | 58.23 | 73.94 | 76.67 | |
| SFT-OSS-distill-32BTraining data type=single-target data2025.10 | 57.82 | 72.12 | 76.66 | |
| s1.1-32BTraining data type=single-target data2025.10 | 54.79 | 70.3 | 73.33 | |
| Multiverse-32BTraining data type=multi-target data2025.10 | 53.8 | — | — | |
| DS-7Bbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 50 | — | — | |
| SafePathbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 48.8 | — | — | |
| SafeChainbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 46.7 | — | — | |
| PreSafebase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 46 | — | — | |
| UnSafeChainbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 40.7 | — | — | |
| R2Dbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 30.7 | — | — | |
| Qwen2.5-32B-InstructTraining data type=single-target data2025.10 | 15.8 | — | — |