Mathematical Reasoning on AIME 25 (avg@16 accuracy)
38.79avg@16 AccuracyQwen3-8B-Base + PASC-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8B-Base + PASC-GRPOmax_completion_tokens=32K2026.01 | 38.79 | |
| Qwen3-8B-Base + GRP-SFTmax_completion_tokens=32K2026.01 | 33.33 | |
| GRPOBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=GRPO2026.03 | 24.4 | |
| Qwen3-4B-Base + PASC-GRPOmax_completion_tokens=32K2026.01 | 24.13 | |
| Gemma-3-27B-ITmax_completion_tokens=32K2026.01 | 24 | |
| ReValBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=ReVal2026.03 | 23.8 | |
| TBRMBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=TBRM2026.03 | 22.1 | |
| DPSK-R1-Distill-1.5BBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=None2026.03 | 20 | |
| Gemma-3-12B-ITmax_completion_tokens=32K2026.01 | 18.8 | |
| Qwen3-4B-Base + GRP-SFTmax_completion_tokens=32K2026.01 | 18.7 | |
| ReValBase Model=Qwen2.5-Math-7B, Training Algorithm=ReVal2026.03 | 13.3 | |
| GRPOBase Model=Qwen2.5-Math-7B, Training Algorithm=GRPO2026.03 | 12.3 | |
| TBRMBase Model=Qwen2.5-Math-7B, Training Algorithm=TBRM2026.03 | 10 | |
| Qwen3-8B-Basemax_completion_tokens=32K2026.01 | 7.6 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Algorithm=None2026.03 | 6.9 | |
| Qwen3-4B-Basemax_completion_tokens=32K2026.01 | 6.33 | |
| LLaMA-3.1-8B-Instructmax_completion_tokens=32K2026.01 | 2.7 | |
| ReProBackbone=Qwen3-8B, Base Training=GRPO2025.12 | 0.685 | |
| GRPOBackbone=Qwen3-8B2025.12 | 0.679 | |
| OriginalBackbone=Qwen3-8B2025.12 | 0.665 |