Mathematical Reasoning on MATH (Exact Match Accuracy)
88.4AccuracyPrefix-RFT*
Evaluation Results
| Method | Links | |
|---|---|---|
| Prefix-RFT*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 88.4 | |
| ICPOBackbone=Qwen2.5-Math-7B2025.10 | 88.4 | |
| LUFFY*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 87.6 | |
| ICPO†Backbone=Qwen2.5-Math-7B2025.10 | 86.6 | |
| SFT+RL_GRPOBackbone=Qwen2.5-Math-7B2025.10 | 85.8 | |
| ReLIFT*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 85 | |
| OpenReasoner-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 82.4 | |
| SFTBackbone=Qwen2.5-Math-7B2025.10 | 82.2 | |
| PRIME-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 81.4 | |
| RL_GRPOBackbone=Qwen2.5-Math-7B2025.10 | 81.2 | |
| Oat-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 78 | |
| SimpleRL-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 76 | |
| Qwen2.5-7B-InstructBase Model=Qwen2.5-7B-Instruct2026.04 | 76 | |
| FineSteerBase Model=Qwen2.5-7B-Instruct2026.04 | 75 | |
| AlphaSteerBase Model=Qwen2.5-7B-Instruct2026.04 | 74 | |
| FineSteerBase Model=Qwen2.5-7B-Instruct, Gating Training Samples=20002026.04 | 74 | |
| AlphaSteerBase Model=Llama-3.1-8B-Instruct2026.04 | 55 | |
| FineSteerBase Model=Llama-3.1-8B-Instruct, Gating Training Samples=20002026.04 | 54 | |
| AlphaSteerBase Model=Llama-3.1-8B-Instruct, Gating Training Samples=20002026.04 | 53 | |
| FineSteerBase Model=Llama-3.1-8B-Instruct2026.04 | 52 | |
| Llama-3.1-8B-InstructBase Model=Llama-3.1-8B-Instruct2026.04 | 51 | |
| AlphaSteerBase Model=Qwen2.5-7B-Instruct, Gating Training Samples=20002026.04 | 48 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2025.10 | 43.6 | |
| UniPROTSelection Protocol=source-wise2026.04 | 38.4 | |
| GREATSSelection Protocol=source-wise2026.04 | 37.84 | |
| UniPROTSelection Protocol=batch-wise2026.04 | 37.76 | |
| COLMSelection Protocol=source-wise2026.04 | 37.28 | |
| GREATSSelection Protocol=batch-wise2026.04 | 37.28 | |
| FTBase Model=PHI-32026.04 | 36.54 | |
| COLMSelection Protocol=batch-wise2026.04 | 36.42 | |
| GradNormSelection Protocol=source-wise2026.04 | 36.1 | |
| BiPOBase Model=Qwen2.5-7B-Instruct2026.04 | 36 | |
| SBERTSelection Protocol=source-wise2026.04 | 35.54 | |
| SBERTSelection Protocol=batch-wise2026.04 | 35.06 | |
| GradNormSelection Protocol=batch-wise2026.04 | 35.03 | |
| MaxLossSelection Protocol=source-wise2026.04 | 32.05 | |
| MaxLossSelection Protocol=batch-wise2026.04 | 30.02 | |
| TruthFlowBase Model=Llama-3.1-8B-Instruct2026.04 | 28 | |
| BiPOBase Model=Llama-3.1-8B-Instruct2026.04 | 3 | |
| TruthFlowBase Model=Qwen2.5-7B-Instruct2026.04 | 0 |