Mathematical Reasoning on AIME 24 (Acc, Len, CR)
73.3AccuracyETR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ETRBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 73.3 | 7.5 | 64.1 | |
| ETRBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 73.3 | 8.6 | 75.4 | |
| PEARBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 70 | 9.9 | 59 | |
| O1-PrunerBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 66.7 | 6.6 | 54.1 | |
| OriginalBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 63.3 | 12.2 | 100 | |
| DEERBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 63.3 | 10.3 | 84.4 | |
| PEARBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 63.3 | 11 | 90.1 | |
| PEARBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 60 | 8.5 | 72.2 | |
| LCPOBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 60 | 7 | 57.4 | |
| NoThinkBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 56.7 | 8.3 | 70.3 | |
| ETRBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 56.7 | 4.6 | 39 | |
| DEERBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 56.7 | 11.5 | 98.3 | |
| OriginalBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 53.3 | 11.7 | 100 | |
| DEERBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 50 | 9.9 | 83.9 | |
| LCPOBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 50 | 6.8 | 57.8 | |
| LCPOBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 50 | 8.2 | 70.6 | |
| O1-PrunerBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 50 | 6.9 | 59 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 46.7 | 7.8 | 66.1 | |
| OriginalBackbone=DeepSeek-R1-Distill-7B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 43.3 | 11.8 | 100 | |
| NoThinkBackbone=Qwen3-8B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 40 | 7 | 57.4 | |
| NoThinkBackbone=Qwen3-4B, Decoding Strategy=greedy decoding (pass@1)2026.04 | 33.3 | 8 | 68.4 |