Mathematical Reasoning on AIME 24 (Avg@16)
46.67Average Score @ 16Qwen3-8B-Base + PASC-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8B-Base + PASC-GRPOmax_completion_tokens=32K2026.01 | 46.67 | |
| Qwen3-8B-Base + GRP-SFTmax_completion_tokens=32K2026.01 | 40 | |
| Scaf-GRPOBackbone=Qwen2.5-Math-7B2025.10 | 35.6 | |
| Qwen3-4B-Base + PASC-GRPOmax_completion_tokens=32K2026.01 | 33.9 | |
| Gemma-3-27B-ITmax_completion_tokens=32K2026.01 | 32.6 | |
| LUFFYBackbone=Qwen2.5-Math-7B2025.10 | 31.9 | |
| Vanilla GRPOBackbone=Qwen2.5-Math-7B2025.10 | 30.7 | |
| Oat-ZeroBackbone=Qwen2.5-Math-7B2025.10 | 30.7 | |
| Scaf-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 28.5 | |
| Vanilla GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 27.1 | |
| Qwen3-4B-Base + GRP-SFTmax_completion_tokens=32K2026.01 | 26.67 | |
| SENTBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 25.21 | |
| SimpleRL-ZeroBackbone=Qwen2.5-Math-7B2025.10 | 22.5 | |
| Gemma-3-12B-ITmax_completion_tokens=32K2026.01 | 22.4 | |
| OpenPangu-embedded-1B-v1.1Base Model=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 17.92 | |
| Scaf-GRPOBackbone=Qwen2.5-7B2025.10 | 15.6 | |
| Scaf-GRPOBackbone=Qwen2.5-Math-1.5B2025.10 | 14.7 | |
| Vanilla GRPOBackbone=Qwen2.5-Math-1.5B2025.10 | 11.8 | |
| Vanilla GRPOBackbone=Qwen2.5-7B2025.10 | 11 | |
| Qwen3-4B-Basemax_completion_tokens=32K2026.01 | 10 | |
| Qwen3-8B-Basemax_completion_tokens=32K2026.01 | 10 | |
| Scaf-GRPOBackbone=Llama-3.2-3B-Instruct2025.10 | 9.6 | |
| Vanilla GRPOBackbone=Llama-3.2-3B-Instruct2025.10 | 7.6 | |
| LLaMA-3.1-8B-Instructmax_completion_tokens=32K2026.01 | 6.3 |