Mathematical Reasoning on AMC 23 (Pass@1)
75Pass@1THR (p = 0.1)
Evaluation Results
| Method | Links | |
|---|---|---|
| THR (p = 0.1)Base Model=Qwen2.5-Math-7B, p=0.12025.10 | 75 | |
| THRBase Model=Qwen2.5-Math-7B2025.10 | 65 | |
| THR (p = 0.1)Base Model=Qwen2.5-Math-1.5B, p=0.12025.10 | 62.5 | |
| GRPOBase Model=Qwen2.5-Math-7B2025.10 | 62.5 | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-7B, p=-0.12025.10 | 62.5 | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-1.5B, p=-0.12025.10 | 60 | |
| ϕDPOBackbone=Qwen-3-4B2026.03 | 58.2 | |
| GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 57.5 | |
| LCO-KLDBackbone=Qwen-3-4B2026.03 | 55.5 | |
| THRBase Model=Qwen2.5-Math-1.5B2025.10 | 55 | |
| DAPOBackbone=Qwen-3-4B2026.03 | 53.15 | |
| LCO-LCHBackbone=Qwen-3-4B2026.03 | 52.7 | |
| GRPOBackbone=Qwen-3-4B2026.03 | 51.95 | |
| LCO-MSEBackbone=Qwen-3-4B2026.03 | 51.3 | |
| GSPOBackbone=Qwen-3-4B2026.03 | 51.2 | |
| π*Backbone=Qwen-3-4B2026.03 | 47.8 | |
| PPOBackbone=Qwen-3-4B2026.03 | 47.5 | |
| REINFORCEBackbone=Qwen-3-4B2026.03 | 46.65 | |
| SFTBackbone=Qwen-3-4B2026.03 | 45.65 | |
| LCO-KLDBackbone=Qwen-2.5-3B2026.03 | 42.65 | |
| BaseBase Model=Qwen2.5-Math-7B2025.10 | 42.5 | |
| GRPOBackbone=Qwen-2.5-3B2026.03 | 41.75 | |
| DAPOBackbone=Qwen-2.5-3B2026.03 | 40.2 | |
| LCO-MSEBackbone=Qwen-2.5-3B2026.03 | 40.2 | |
| REINFORCEBackbone=Qwen-2.5-3B2026.03 | 40.15 | |
| LCO-LCHBackbone=Qwen-2.5-3B2026.03 | 39.5 | |
| PPOBackbone=Qwen-2.5-3B2026.03 | 39.2 | |
| GSPOBackbone=Qwen-2.5-3B2026.03 | 38.75 | |
| ϕDPOBackbone=Qwen-2.5-3B2026.03 | 35.7 | |
| π*Backbone=Qwen-2.5-3B2026.03 | 28.4 | |
| SFTBackbone=Qwen-2.5-3B2026.03 | 27.5 | |
| THR (p = -0.2)Base Model=Qwen2.5-0.5B-Ins, p=-0.22025.10 | 20 | |
| BaseBase Model=Qwen2.5-Math-1.5B2025.10 | 20 | |
| THR (p = 0.2)Base Model=Qwen2.5-0.5B-Ins, p=0.22025.10 | 17.5 | |
| THRBase Model=Qwen2.5-0.5B-Ins2025.10 | 15 | |
| GRPOBase Model=Qwen2.5-0.5B-Ins2025.10 | 7.5 | |
| BaseBase Model=Qwen2.5-0.5B-Ins2025.10 | 2.5 |