Mathematical Reasoning on AMC_AIME
68.77AccuracyPIR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PIRBackbone=QwQ-32B2026.02 | 68.77 | 2,126.18 | |
| PIRBackbone=DeepSeek-R1-32B2026.02 | 67.4 | 2,935.83 | |
| PIRBackbone=DeepSeek-R1-14B2026.02 | 66 | 1,618.75 | |
| QwQ-32BBackbone=QwQ-32B2026.02 | 64.45 | 5,297.53 | |
| PIRBackbone=DeepSeek-R1-7B2026.02 | 64.4 | 1,475 | |
| DeepSeek-R1-14BBackbone=DeepSeek-R1-14B2026.02 | 63.75 | 4,223.15 | |
| DeepSeek-R1-7BBackbone=DeepSeek-R1-7B2026.02 | 62.53 | 2,207.9 | |
| DeepSeek-R1-32BBackbone=DeepSeek-R1-32B2026.02 | 59.92 | 3,661.52 | |
| DAREModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 50.6 | — | |
| EDCOModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 46.99 | — | |
| MoPPSModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 46.99 | — | |
| GRPOModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 45.78 | — | |
| DOTSModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 45.78 | — | |
| Previous FR EstimationModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 44.58 | — | |
| LLM-JudgeModel=Qwen2.5-Math-1.5B, Decoding=greedy decoding2026.05 | 42.17 | — |