Mathematical Reasoning on Gaokao 2023
76.6AccuracyAgentic-Verifier-Qwen3-4B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Agentic-Verifier-Qwen3-4BRefinement Turn=22026.04 | 76.6 | — | — | — | 3.4 | 2.3 | |
| Agentic-Verifier-Qwen3-4BRefinement Turn=32026.04 | 76.4 | — | — | — | 2.6 | 2.9 | |
| Agentic-Verifier-Qwen3-4BRefinement Turn=12026.04 | 75.6 | — | — | — | 40.3 | 1.8 | |
| DS-Distill-14BRefinement Turn=32026.04 | 73 | — | — | — | 4.4 | 1.6 | |
| DS-Distill-14BRefinement Turn=22026.04 | 70.1 | — | — | — | 4.7 | 1.6 | |
| Qwen3-4B-ThinkRefinement Turn=32026.04 | 69.6 | — | — | — | 2.3 | 1.6 | |
| Qwen3-4B-ThinkRefinement Turn=22026.04 | 69.1 | — | — | — | 5.5 | 1.3 | |
| AbstRaLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=AbstRaL, Evaluation Protocol=Zero-shot2025.06 | 68.3 | — | — | — | — | — | |
| Ori-SFTModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=Ori-SFT, Evaluation Protocol=Zero-shot2025.06 | 67.5 | — | — | — | — | — | |
| CoT-RLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoT-RL, Evaluation Protocol=Zero-shot2025.06 | 67.5 | — | — | — | — | — | |
| CoAModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoA, Evaluation Protocol=Zero-shot2025.06 | 67 | — | — | — | — | — | |
| DS-Distill-14BRefinement Turn=12026.04 | 67 | — | — | — | 32.5 | 2.6 | |
| Qwen3-4B-ThinkRefinement Turn=12026.04 | 64.9 | — | — | — | 31.2 | 3.4 | |
| HiPO-Mt-biasBackbone=Qwen2.5-7B-Instruct2026.04 | 62.18 | — | — | — | — | — | |
| HiPO-Rq+Mt-biasBackbone=Qwen2.5-7B-Instruct2026.04 | 61.11 | — | — | — | — | — | |
| HiPO-Rq-biasBackbone=Qwen2.5-7B-Instruct2026.04 | 59.49 | — | — | — | — | — | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.04 | 58.61 | — | — | — | — | — | |
| DPOBackbone=Qwen2.5-7B-Instruct2026.04 | 57.53 | — | — | — | — | — | |
| Mistral-Small-24B-InstructRefinement Turn=22026.04 | 52.7 | — | — | — | 4.9 | 1.3 | |
| Qwen2.5-7B-InstructRefinement Turn=32026.04 | 52.2 | — | — | — | 3.64 | 1.3 | |
| Mistral-Small-24B-InstructRefinement Turn=32026.04 | 52.2 | — | — | — | 2.08 | 2.6 | |
| Qwen2.5-7B-InstructRefinement Turn=22026.04 | 49.9 | — | — | — | 5.2 | 2.3 | |
| HiPO-Rq-biasBackbone=Llama-3.1-8B-Instruct2026.04 | 49.19 | — | — | — | — | — | |
| Mistral-Small-24B-InstructRefinement Turn=12026.04 | 49.1 | — | — | — | 15.6 | 3.6 | |
| Llama3.1-8B-InstructRefinement Turn=22026.04 | 48.1 | — | — | — | 5.2 | 2.1 | |
| HiPO-Mt-biasBackbone=Llama-3.1-8B-Instruct2026.04 | 47.96 | — | — | — | — | — | |
| Qwen2.5-7B-InstructRefinement Turn=12026.04 | 47 | — | — | — | 12.7 | 2.9 | |
| Llama3.1-8B-InstructRefinement Turn=32026.04 | 47 | — | — | — | 1.3 | 2.3 | |
| HiPO-Rq+Mt-biasBackbone=Llama-3.1-8B-Instruct2026.04 | 46.44 | — | — | — | — | — | |
| BaseBackbone=Llama-3.1-8B-Instruct2026.04 | 46.03 | — | — | — | — | — | |
| Llama3.1-8B-InstructRefinement Turn=12026.04 | 44.9 | — | — | — | 10.7 | 2.9 | |
| DPOBackbone=Llama-3.1-8B-Instruct2026.04 | 44.73 | — | — | — | — | — | |
| AbstRaLModel=Qwen2.5-0.5B-Instruct, GSM Train Method=AbstRaL, Evaluation Protocol=Zero-shot2025.06 | 29.1 | — | — | — | — | — | |
| Ori-SFTModel=Qwen2.5-0.5B-Instruct, GSM Train Method=Ori-SFT, Evaluation Protocol=Zero-shot2025.06 | 27 | — | — | — | — | — | |
| CoAModel=Qwen2.5-0.5B-Instruct, GSM Train Method=CoA, Evaluation Protocol=Zero-shot2025.06 | 23.9 | — | — | — | — | — | |
| CoT-RLModel=Qwen2.5-0.5B-Instruct, GSM Train Method=CoT-RL, Evaluation Protocol=Zero-shot2025.06 | 16.6 | — | — | — | — | — | |
| BiRMBase Model=Qwen2.5-3B2025.03 | — | 36.9 | 37.8 | 38.7 | — | — | |
| BiRMBase Model=Qwen2.5-7B2025.03 | — | 47.7 | 49.1 | 50.4 | — | — | |
| BiRMBase Model=Llama3.1-8B2025.03 | — | 29.4 | 30 | 29.6 | — | — | |
| ER-PRMBase Model=Qwen2.5-3B2025.03 | — | 36.2 | 36.3 | 35.8 | — | — | |
| ER-PRMBase Model=Qwen2.5-7B2025.03 | — | 47 | 47.2 | 47.3 | — | — | |
| ER-PRMBase Model=Llama3.1-8B2025.03 | — | 25.7 | 26.1 | 24.9 | — | — | |
| GreedyBase Model=Qwen2.5-3B2025.03 | — | 27 | 27 | 27 | — | — | |
| GreedyBase Model=Qwen2.5-7B2025.03 | — | 33.5 | 33.5 | 33.5 | — | — | |
| GreedyBase Model=Llama3.1-8B2025.03 | — | 17.1 | 17.1 | 17.1 | — | — | |
| Majority VoteBase Model=Qwen2.5-3B2025.03 | — | 35.8 | 36.3 | 36.1 | — | — | |
| Majority VoteBase Model=Qwen2.5-7B2025.03 | — | 45.5 | 45.4 | 45.2 | — | — | |
| Majority VoteBase Model=Llama3.1-8B2025.03 | — | 26.5 | 27.2 | 27.1 | — | — | |
| Math-ShepherdBase Model=Qwen2.5-3B2025.03 | — | 36.6 | 36.4 | 36.1 | — | — | |
| Math-ShepherdBase Model=Qwen2.5-7B2025.03 | — | 46.4 | 47 | 46.5 | — | — | |
| Math-ShepherdBase Model=Llama3.1-8B2025.03 | — | 25.8 | 25.8 | 26.2 | — | — | |
| ORMBase Model=Qwen2.5-3B2025.03 | — | 37.2 | 37 | 35.8 | — | — | |
| ORMBase Model=Qwen2.5-7B2025.03 | — | 43.6 | 43.5 | 41.3 | — | — | |
| ORMBase Model=Llama3.1-8B2025.03 | — | 25.4 | 25.2 | 24.9 | — | — | |
| PRMBase Model=Qwen2.5-3B2025.03 | — | 37.3 | 37.1 | 37.2 | — | — | |
| PRMBase Model=Qwen2.5-7B2025.03 | — | 45.8 | 46.2 | 47.3 | — | — | |
| PRMBase Model=Llama3.1-8B2025.03 | — | 28.2 | 27.7 | 27.3 | — | — |