Mathematical Reasoning on AMC 23 (Accuracy @avg1)
80.74Accuracy (@avg1)GOLF
Evaluation Results
| Method | Links | |
|---|---|---|
| GOLFBackbone=Qwen-3-8B2026.03 | 80.74 | |
| GRPOBackbone=Qwen-3-8B2026.03 | 78.61 | |
| Critique-GRPOBackbone=Qwen-3-8B2026.03 | 77.58 | |
| GOLFBackbone=Qwen-3-4B2026.03 | 77.15 | |
| GRPOBackbone=Qwen-3-4B2026.03 | 76.85 | |
| Critique-GRPOBackbone=Qwen-3-4B2026.03 | 76.14 | |
| Critique-FTBackbone=Qwen-3-8B2026.03 | 70.31 | |
| KL-CovBackbone=Qwen2.5-Math-7B2025.11 | 70 | |
| LESSBackbone=Qwen2.5-Math-7B2025.11 | 70 | |
| Refinement-FTBackbone=Qwen-3-8B2026.03 | 67.81 | |
| Forking TokensBackbone=Qwen2.5-Math-7B2025.11 | 67.5 | |
| LESSBackbone=Qwen2.5-Base-7B2025.11 | 67.5 | |
| Critique-FTBackbone=Qwen-3-4B2026.03 | 65.94 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.11 | 65 | |
| Refinement-FTBackbone=Qwen-3-4B2026.03 | 64.06 | |
| LESSBackbone=Qwen2.5-Math-1.5B2025.11 | 62.5 | |
| Forking TokensBackbone=Qwen2.5-Base-7B2025.11 | 62.5 | |
| Qwen-3-8BTraining Method=SFT2026.03 | 61.32 | |
| Forking TokensBackbone=Qwen2.5-Math-1.5B2025.11 | 60 | |
| GRPOBackbone=Qwen2.5-Base-7B2025.11 | 60 | |
| KL-CovBackbone=Qwen2.5-Base-7B2025.11 | 60 | |
| Qwen-3-4BTraining Method=SFT2026.03 | 59.41 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2025.11 | 57.5 | |
| KL-CovBackbone=Qwen2.5-Math-1.5B2025.11 | 57.5 | |
| Base LLMBackbone=Qwen2.5-Math-7B2025.11 | 57.5 | |
| Base LLMBackbone=Qwen2.5-Math-1.5B2025.11 | 37.5 | |
| Base LLMBackbone=Qwen2.5-Base-7B2025.11 | 37.5 |