Mathematical Reasoning on AIME 2025 (Pass@1, LEN, TE)
67.3Pass@1Qwen3-8B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-8BBackbone=Qwen3-8B2026.02 | 67.3 | 18,342 | 3.67 | |
| GRPOBackbone=Qwen3-8B2026.02 | 66.6 | 13,981 | 4.76 | |
| SAGE-GRPOBackbone=Qwen3-8B2026.02 | 66.6 | 10,052 | 6.58 | |
| GSPOBackbone=Qwen3-8B2026.02 | 66.2 | 14,082 | 4.7 | |
| SAGE-GSPOBackbone=Qwen3-8B2026.02 | 66 | 9,183 | 7.19 | |
| GRPOBackbone=DS-7B2026.02 | 38.4 | 10,123 | 3.79 | |
| SAGE-GRPOBackbone=DS-7B2026.02 | 38 | 6,583 | 5.77 | |
| DS-7BBackbone=DS-7B2026.02 | 37.1 | 12,540 | 2.96 | |
| Efficient ReasoningBackbone=DS-7B2026.02 | 36.2 | 7,501 | 4.82 | |
| GRPO-LEADBackbone=DS-7B2026.02 | 36.1 | 7,842 | 4.6 | |
| LC-R1Backbone=DS-7B2026.02 | 35.7 | 7,458 | 4.79 | |
| AdaptThinkBackbone=DS-7B2026.02 | 35 | 7,807 | 4.48 | |
| GRPOBackbone=DeepScaleR2026.02 | 27.4 | 8,185 | 3.35 | |
| SAGE-GRPOBackbone=DeepScaleR2026.02 | 27.2 | 7,704 | 3.53 | |
| SAGE-GSPOBackbone=DS-1.5B2026.02 | 27.1 | 7,167 | 3.78 | |
| SAGE-GRPOBackbone=DS-1.5B2026.02 | 26.5 | 7,479 | 3.54 | |
| ThinkPrune-2kBackbone=DeepScaleR2026.02 | 26 | 7,486 | 3.47 | |
| DeepScaleRBackbone=DeepScaleR2026.02 | 25.4 | 9,310 | 2.73 | |
| GSPOBackbone=DS-1.5B2026.02 | 25.1 | 8,227 | 3.05 | |
| GRPOBackbone=DS-1.5B2026.02 | 24.1 | 8,263 | 2.92 | |
| Efficient ReasoningBackbone=DS-1.5B2026.02 | 22.9 | 8,590 | 2.67 | |
| AdaptThinkBackbone=DS-1.5B2026.02 | 21.8 | 8,155 | 2.67 | |
| DS-1.5BBackbone=DS-1.5B2026.02 | 20.9 | 11,669 | 1.79 | |
| LC-R1Backbone=DS-1.5B2026.02 | 20.9 | 6,942 | 3.01 | |
| ThinkPrune-2kBackbone=DS-1.5B2026.02 | 19.7 | 6,918 | 2.85 | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 19.7 | — | — | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 19.1 | — | — | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 17.1 | — | — | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 16 | — | — | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 13.2 | — | — | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 12.8 | — | — | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 12 | — | — | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 11.3 | — | — |