Mathematical Reasoning on AIME 24 (Pass@1, Pass@5, Pass@10)
39.2Pass@1LP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LPModel=Qwen3-8B2026.03 | 39.2 | 55.8 | 59.1 | |
| S-RLModel=Qwen3-8B2026.03 | 36.2 | 52.7 | 60.4 | |
| EntModel=Qwen3-8B2026.03 | 31.7 | 48 | 53.5 | |
| CH2Model=Qwen3-8B2026.03 | 30.8 | 46.4 | 50.4 | |
| AvgEntModel=Qwen3-8B2026.03 | 25.4 | 38.6 | 42.9 | |
| S-RLModel=DeepSeek-Distill Llama-8B2026.03 | 24.4 | 44.9 | 54.9 | |
| EntModel=Qwen3-1.7B2026.03 | 22.5 | 42.6 | 49.3 | |
| LP†Model=DeepSeek-Distill Llama-8B2026.03 | 21.7 | 43.1 | 52.8 | |
| CH2Model=Qwen3-1.7B2026.03 | 20.6 | 35.8 | 40.4 | |
| CH2†Model=DeepSeek-Distill Llama-8B2026.03 | 20.6 | 40.9 | 50.3 | |
| AvgEntModel=Qwen3-1.7B2026.03 | 20.2 | 38.8 | 49.1 | |
| LPModel=Qwen3-1.7B2026.03 | 20 | 34.2 | 39.3 | |
| Ent†Model=DeepSeek-Distill Llama-8B2026.03 | 18.1 | 37.9 | 47.5 | |
| S-RLModel=Qwen3-1.7B2026.03 | 17.9 | 31 | 37.8 | |
| AvgEnt†Model=DeepSeek-Distill Llama-8B2026.03 | 16.7 | 36.8 | 45.2 | |
| BaseModel=DeepSeek-Distill Llama-8B2026.03 | 16.5 | 30.3 | 37.9 | |
| BaseModel=Qwen3-8B2026.03 | 7.7 | 19.9 | 23.1 | |
| BaseModel=Qwen3-1.7B2026.03 | 6 | 14.2 | 19.1 | |
| BaseModel=Llama3.1-8B2026.03 | 5.2 | 14.3 | 20.8 | |
| S-RLModel=Llama3.1-8B2026.03 | 4.6 | 13.2 | 18.7 |