Mathematical Reasoning on Average Across all benchmarks (Pass@K)
63.1Pass@1LP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LPModel=Qwen3-8B2026.03 | 63.1 | 71.5 | 73.8 | |
| S-RLModel=Qwen3-8B2026.03 | 62.6 | 70.6 | 73.1 | |
| EntModel=Qwen3-8B2026.03 | 60.7 | 69.3 | 71.9 | |
| CH2Model=Qwen3-8B2026.03 | 59.9 | 69.2 | 71.8 | |
| AvgEntModel=Qwen3-8B2026.03 | 55.7 | 65.6 | 68.6 | |
| LPModel=Qwen3-1.7B2026.03 | 52.7 | 65 | 68.5 | |
| EntModel=Qwen3-1.7B2026.03 | 52.2 | 65.1 | 68.7 | |
| CH2Model=Qwen3-1.7B2026.03 | 52.1 | 64.5 | 68.1 | |
| AvgEntModel=Qwen3-1.7B2026.03 | 51.2 | 64.3 | 68.1 | |
| S-RLModel=Qwen3-1.7B2026.03 | 51 | 63.3 | 67 | |
| S-RLModel=DeepSeek-Distill Llama-8B2026.03 | 47.4 | 65.4 | 70.6 | |
| LP†Model=DeepSeek-Distill Llama-8B2026.03 | 44.7 | 62.9 | 68.4 | |
| CH2†Model=DeepSeek-Distill Llama-8B2026.03 | 44.5 | 62.1 | 67.5 | |
| Ent†Model=DeepSeek-Distill Llama-8B2026.03 | 44.4 | 62.8 | 68.4 | |
| AvgEnt†Model=DeepSeek-Distill Llama-8B2026.03 | 44 | 61.4 | 66.9 | |
| BaseModel=DeepSeek-Distill Llama-8B2026.03 | 43.9 | 61.5 | 67 | |
| BaseModel=Qwen3-1.7B2026.03 | 42.7 | 54 | 58.5 | |
| BaseModel=Qwen3-8B2026.03 | 41 | 53.4 | 58.3 | |
| S-RLModel=Llama3.1-8B2026.03 | 26.4 | 45.4 | 52.7 | |
| BaseModel=Llama3.1-8B2026.03 | 24.9 | 44.1 | 52.1 |