Mathematical Reasoning on Olympiad (Pass@1, # Tokens)
54.4Pass@1GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B2026.02 | 54.4 | 2,167 | |
| LACONICBackbone=Qwen3-8B, Target Tokens=10002026.02 | 53.05 | 1,166 | |
| L1-MaxBackbone=Qwen3-8B2026.02 | 51.11 | 1,209 | |
| L1-ExactBackbone=Qwen3-8B2026.02 | 48.54 | 1,254 | |
| THR (p = 0.1)Base Model=Qwen2.5-Math-7B, p=0.12025.10 | 43.4 | — | |
| THRBase Model=Qwen2.5-Math-7B2025.10 | 43.1 | — | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-7B, p=-0.12025.10 | 42.4 | — | |
| GRPOBase Model=Qwen2.5-Math-7B2025.10 | 42.1 | — | |
| THR (p = 0.1)Base Model=Qwen2.5-Math-1.5B, p=0.12025.10 | 34.5 | — | |
| GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 34.1 | — | |
| THRBase Model=Qwen2.5-Math-1.5B2025.10 | 34.1 | — | |
| THR (p = -0.1)Base Model=Qwen2.5-Math-1.5B, p=-0.12025.10 | 32.7 | — | |
| BaseBase Model=Qwen2.5-Math-7B2025.10 | 26.7 | — | |
| BaseBase Model=Qwen2.5-Math-1.5B2025.10 | 24.9 | — | |
| GRPOBase Model=Qwen2.5-0.5B-Ins2025.10 | 9.9 | — | |
| THR (p = -0.2)Base Model=Qwen2.5-0.5B-Ins, p=-0.22025.10 | 8.9 | — | |
| THRBase Model=Qwen2.5-0.5B-Ins2025.10 | 7.6 | — | |
| BaseBase Model=Qwen2.5-0.5B-Ins2025.10 | 7 | — | |
| THR (p = 0.2)Base Model=Qwen2.5-0.5B-Ins, p=0.22025.10 | 6.5 | — |