Mathematical Reasoning on AMC 23 (Pass@1, Pass@5, Pass@10)
78.8Pass@1LP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LPModel=Qwen3-8B2026.03 | 78.8 | 93 | 94.9 | |
| S-RLModel=Qwen3-8B2026.03 | 76.2 | 87.9 | 89.1 | |
| EntModel=Qwen3-8B2026.03 | 74.1 | 89.4 | 91.5 | |
| CH2Model=Qwen3-8B2026.03 | 73.1 | 88.9 | 91.8 | |
| AvgEntModel=Qwen3-8B2026.03 | 62 | 81.6 | 88.4 | |
| EntModel=Qwen3-1.7B2026.03 | 61.3 | 81.8 | 88.1 | |
| CH2Model=Qwen3-1.7B2026.03 | 59.5 | 78.7 | 85.6 | |
| S-RLModel=DeepSeek-Distill Llama-8B2026.03 | 59.4 | 86.9 | 91.1 | |
| AvgEntModel=Qwen3-1.7B2026.03 | 58.3 | 80.3 | 87.9 | |
| LPModel=Qwen3-1.7B2026.03 | 57.8 | 79.7 | 86.8 | |
| S-RLModel=Qwen3-1.7B2026.03 | 56.6 | 76 | 82.1 | |
| CH2†Model=DeepSeek-Distill Llama-8B2026.03 | 54.7 | 83.7 | 88.7 | |
| AvgEnt†Model=DeepSeek-Distill Llama-8B2026.03 | 53.8 | 81.7 | 87.5 | |
| Ent†Model=DeepSeek-Distill Llama-8B2026.03 | 53.4 | 83.8 | 88.5 | |
| BaseModel=DeepSeek-Distill Llama-8B2026.03 | 50.8 | 80.6 | 86.9 | |
| LP†Model=DeepSeek-Distill Llama-8B2026.03 | 50.8 | 81.4 | 87 | |
| BaseModel=Qwen3-1.7B2026.03 | 47.2 | 61.4 | 68 | |
| BaseModel=Qwen3-8B2026.03 | 41.7 | 64.1 | 73.6 | |
| S-RLModel=Llama3.1-8B2026.03 | 23.6 | 46.8 | 56.1 | |
| BaseModel=Llama3.1-8B2026.03 | 22.7 | 51.6 | 66.4 |