Mathematical Reasoning on GSM8k (Pass@1 Acc)
86Pass@1 Accuracy+10k SFT (Random)
Evaluation Results
| Method | Links | |
|---|---|---|
| +10k SFT (Random)Backbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 86 | |
| STAT-SynBackbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 85 | |
| AUTOSKILLBackbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 84.5 | |
| ReasonFlux-PRMBackbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 81.5 | |
| AUTOSKILLBackbone=Llama3-8B-Instruct, SFT examples=1k, epochs=42026.04 | 77.5 | |
| s1K-1.1 (DeepSeek)Backbone=Llama3-8B-Instruct, SFT examples=1k, epochs=42026.04 | 77 | |
| +1k SFT (Random)Backbone=Llama3-8B-Instruct, SFT examples=1k, epochs=42026.04 | 76.25 | |
| AUTOSKILLBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 73.43 | |
| Difficulty-lowBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 73 | |
| Remove-outliersBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 72.5 | |
| Long-examplesBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 72.25 | |
| Correctness-lowBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 72.25 | |
| DeduplicationBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 71.75 | |
| Repetition-lowBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 71.75 | |
| Best HeuristicBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 71.75 | |
| AUTOSKILLBackbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 70.75 | |
| Difficulty-highBackbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 70.62 | |
| Best HeuristicBackbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 70.62 | |
| Repetition-lowBackbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 70.56 | |
| +25k SFT (Random)Backbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 70.46 | |
| +25k SFT (Random)Backbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 70 | |
| Long-examplesBackbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 69 | |
| Correctness-highBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 68.5 | |
| LIMOBackbone=Llama3-8B-Instruct, SFT examples=1k, epochs=42026.04 | 68.25 | |
| Difficulty-highBackbone=Qwen2.5-3B, SFT examples=25k, Temperature=1.02026.04 | 67 | |
| ReasonFlux-PRMBackbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 65.75 | |
| Remove-outliersBackbone=Llama3-8B-Instruct, SFT examples=25k, epochs=12026.04 | 65.62 | |
| Qwen2.5-3BBackbone=Qwen2.5-3B2026.04 | 56.62 | |
| ReasonFlux-PRMBackbone=Llama3-8B-Instruct, SFT examples=1k, epochs=42026.04 | 56 | |
| STAT-SelBackbone=Qwen2.5-3B, SFT examples=10k, Temperature=0.12026.04 | 49 | |
| s1K-1.1 (Gemini)Backbone=Llama3-8B-Instruct, SFT examples=1k, epochs=42026.04 | 44.75 | |
| Llama3-8B-InstructBackbone=Llama3-8B-Instruct2026.04 | 44.25 |