Mathematical Reasoning on MATH (pass@1/pass@5)
55.9Multi-step pass@5 AccuracyDRIFT-5turn
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DRIFT-5turnBackbone=Qwen2.5-3B-Instruct, Protocol=Ours, Max turns=52026.05 | 55.9 | — | — | |
| UFO-5turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=52026.05 | 55.5 | — | — | |
| PPOBackbone=Qwen2.5-3B-Instruct, Protocol=Single-turn baselines2026.05 | 53.5 | — | — | |
| SFT-5turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=52026.05 | 53.3 | — | — | |
| SCoRe-2turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=22026.05 | 53 | — | — | |
| SFTBackbone=Qwen2.5-3B-Instruct, Protocol=Single-turn baselines2026.05 | 51.2 | — | — | |
| STaR-2turnBackbone=Qwen2.5-3B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=22026.05 | 50.2 | — | — | |
| DRIFT-5turnBackbone=Llama3.1-8B-Instruct, Protocol=Ours, Max turns=52026.05 | 45.4 | — | — | |
| UFO-5turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=52026.05 | 43.1 | — | — | |
| SCoRe-2turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Online), Max turns=22026.05 | 42.8 | — | — | |
| SFTBackbone=Llama3.1-8B-Instruct, Protocol=Single-turn baselines2026.05 | 42.4 | — | — | |
| STaR-2turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=22026.05 | 41.7 | — | — | |
| SFT-5turnBackbone=Llama3.1-8B-Instruct, Protocol=Multi-turn baselines (Offline), Max turns=52026.05 | 41.3 | — | — | |
| PPOBackbone=Llama3.1-8B-Instruct, Protocol=Single-turn baselines2026.05 | 40.9 | — | — | |
| BaseBackbone=Qwen2.5-3B-Instruct, Protocol=Single-turn baselines2026.05 | 38.3 | — | — | |
| BaseBackbone=Llama3.1-8B-Instruct, Protocol=Single-turn baselines2026.05 | 36.8 | — | — | |
| Base ModelBackbone=Llama-3.2-3B-Instruct2025.10 | — | 24 | 33.2 | |
| CAABackbone=Llama-3.2-3B-Instruct, Synthetic Data Strategy=GUIDEDSAMPLING - Concepts and Answer (CAA)2025.10 | — | 38 | 60.06 | |
| FABackbone=Llama-3.2-3B-Instruct, Synthetic Data Strategy=GUIDEDSAMPLING - Final Answer (FA)2025.10 | — | 29.88 | 47.98 | |
| RSBackbone=Llama-3.2-3B-Instruct, Synthetic Data Strategy=Repeated Sampling2025.10 | — | 37.62 | 44.78 | |
| STaRBackbone=Llama-3.2-3B-Instruct, Synthetic Data Strategy=Self-Taught Reasoner2025.10 | — | 36.6 | 46.23 | |
| ToTBackbone=Llama-3.2-3B-Instruct, Synthetic Data Strategy=Tree-of-Thought2025.10 | — | 40.4 | 56.63 |