Mathematical Reasoning on GSM8K 8-shot (test)
93.5AccuracyQwen2.5-7B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct, Few-shot=8-shot2026.03 | 93.5 | |
| MIPOBackbone=Qwen2.5-7B-Instruct, Training=MIPO, Few-shot=8-shot2026.03 | 93 | |
| SFTBackbone=Qwen2.5-7B-Instruct, Training=SFT, Few-shot=8-shot2026.03 | 92.5 | |
| RLVRBackbone=Qwen2.5-7B-Instruct, Training=RLVR, Ground-truth usage=true, Few-shot=8-shot2026.03 | 92.5 | |
| SFTBackbone=Qwen2.5-7B-Instruct, Training=SFT, Ground-truth usage=true, Few-shot=8-shot2026.03 | 92 | |
| MIPOBackbone=Qwen2.5-3B-Instruct, Training=MIPO, Few-shot=8-shot2026.03 | 89.17 | |
| SFTBackbone=Qwen2.5-3B-Instruct, Training=SFT, Few-shot=8-shot2026.03 | 85.83 | |
| Qwen2.5-3B-InstructBackbone=Qwen2.5-3B-Instruct, Few-shot=8-shot2026.03 | 84.5 | |
| SFTBackbone=Qwen2.5-3B-Instruct, Training=SFT, Ground-truth usage=true, Few-shot=8-shot2026.03 | 83.83 | |
| RLVRBackbone=Qwen2.5-3B-Instruct, Training=RLVR, Ground-truth usage=true, Few-shot=8-shot2026.03 | 82.83 | |
| RLVRBackbone=Llama-3.2-3B-Instruct, Training=RLVR, Ground-truth usage=true, Few-shot=8-shot2026.03 | 71.67 | |
| Llama-3.2-3B-InstructBackbone=Llama-3.2-3B-Instruct, Few-shot=8-shot2026.03 | 71 | |
| MIPOBackbone=Qwen2.5-1.5B-Instruct, Training=MIPO, Few-shot=8-shot2026.03 | 71 | |
| MIPOBackbone=Llama-3.2-3B-Instruct, Training=MIPO, Few-shot=8-shot2026.03 | 70.17 | |
| SFTBackbone=Llama-3.2-3B-Instruct, Training=SFT, Ground-truth usage=true, Few-shot=8-shot2026.03 | 69.17 | |
| SFTBackbone=Qwen2.5-1.5B-Instruct, Training=SFT, Ground-truth usage=true, Few-shot=8-shot2026.03 | 67.5 | |
| SFTBackbone=Qwen2.5-1.5B-Instruct, Training=SFT, Few-shot=8-shot2026.03 | 67 | |
| Qwen2.5-1.5B-InstructBackbone=Qwen2.5-1.5B-Instruct, Few-shot=8-shot2026.03 | 65.5 | |
| SFTBackbone=Llama-3.2-3B-Instruct, Training=SFT, Few-shot=8-shot2026.03 | 64.5 | |
| RLVRBackbone=Qwen2.5-1.5B-Instruct, Training=RLVR, Ground-truth usage=true, Few-shot=8-shot2026.03 | 62.5 | |
| MIPOBackbone=Llama-3.2-1B-Instruct, Training=MIPO, Few-shot=8-shot2026.03 | 29.5 | |
| SFTBackbone=Llama-3.2-1B-Instruct, Training=SFT, Few-shot=8-shot2026.03 | 24.83 | |
| SFTBackbone=Llama-3.2-1B-Instruct, Training=SFT, Ground-truth usage=true, Few-shot=8-shot2026.03 | 24.17 | |
| Llama-3.2-1B-InstructBackbone=Llama-3.2-1B-Instruct, Few-shot=8-shot2026.03 | 22 | |
| RLVRBackbone=Llama-3.2-1B-Instruct, Training=RLVR, Ground-truth usage=true, Few-shot=8-shot2026.03 | 10.67 |