Mathematical Reasoning on AIME 2025 (Pass@1, Avg@8, Pass@8)
36.67Pass@1MEL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MELBackbone=Qwen3-14B-Base2026.02 | 36.67 | 30 | 46.67 | |
| GRPOBackbone=Qwen3-14B-Base2026.02 | 33.33 | 24.17 | 43.33 | |
| MELBackbone=Qwen3-8B-Base2026.02 | 23.33 | 23.33 | 36.67 | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-7B, p=-0.12025.10 | 23.3 | — | — | |
| GRPOBackbone=Qwen3-8B-Base2026.02 | 20 | 20.83 | 36.67 | |
| THR (p = 0.1)Base Model=Qwen2.5-Math-7B, p=0.12025.10 | 20 | — | — | |
| MELBackbone=Qwen3-4B-Base2026.02 | 16.67 | 18.33 | 33 | |
| BaselineBackbone=Qwen3-8B-Base2026.02 | 13.33 | 15 | 33.33 | |
| BaseBase Model=Qwen2.5-Math-7B2025.10 | 13.3 | — | — | |
| GRPOBase Model=Qwen2.5-Math-7B2025.10 | 13.3 | — | — | |
| BaselineBackbone=Qwen3-4B-Base2026.02 | 10 | 6.56 | 23.33 | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-1.5B, p=-0.12025.10 | 10 | — | — | |
| THRBase Model=Qwen2.5-Math-7B2025.10 | 10 | — | — | |
| GRPOBackbone=Qwen3-4B-Base2026.02 | 6.67 | 17.5 | 30 | |
| BaselineBackbone=Qwen3-14B-Base2026.02 | 6.66 | 9.58 | 33.33 | |
| GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 3.3 | — | — | |
| THRBase Model=Qwen2.5-Math-1.5B2025.10 | 3.3 | — | — | |
| THR (p = 0.1)Base Model=Qwen2.5-Math-1.5B, p=0.12025.10 | 3.3 | — | — | |
| BaseBase Model=Qwen2.5-0.5B-Ins2025.10 | 0 | — | — | |
| GRPOBase Model=Qwen2.5-0.5B-Ins2025.10 | 0 | — | — | |
| THRBase Model=Qwen2.5-0.5B-Ins2025.10 | 0 | — | — | |
| THR (p = -0.2)Base Model=Qwen2.5-0.5B-Ins, p=-0.22025.10 | 0 | — | — | |
| THR (p = 0.2)Base Model=Qwen2.5-0.5B-Ins, p=0.22025.10 | 0 | — | — | |
| BaseBase Model=Qwen2.5-Math-1.5B2025.10 | 0 | — | — |