Scientific Reasoning on GPQA (test) (pass@1)
70.8Pass@1Qwen2.5-32B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (S-D D-S R-S)2025.08 | 70.8 | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=D-S2025.08 | 70.2 | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (S-D D-S R-R)2025.08 | 70.2 | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=D-S2025.08 | 70.2 | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=S-D2025.08 | 69.7 | |
| Qwen2.5-32B-InstructDataset Size=1K, Training Method=SFT, Strategy=Merge2025.08 | 68.7 | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (R-S D-R S-S)2025.08 | 68.2 | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=S-S2025.08 | 67.8 | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=Majority Vote (D-S S-S S-S)2025.08 | 67.8 | |
| LIMO-32BDataset Size=1k, Training Method=SFT2025.08 | 66.7 | |
| DeepSeek-Qwen-32BDataset Size=1K, Training Method=SFT, Strategy=R-D2025.08 | 66.2 | |
| OpenThinker2-32BDataset Size=1000K, Training Method=SFT2025.08 | 64.1 | |
| S1.1-32BDataset Size=1k, Training Method=SFT2025.08 | 63.6 | |
| OpenThinker-32BDataset Size=114k, Training Method=SFT2025.08 | 63.5 | |
| S1-32BDataset Size=1k, Training Method=SFT2025.08 | 59.6 | |
| DeepSeek-Qwen-32BDataset Size=800K, Training Method=SFT, Decoding Strategy=Greedy Decoding2025.08 | 50 |