Mathematical Reasoning on MATH 500 (Pass@1, LEN, TE)
95Pass@1SAGE-GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SAGE-GRPOBackbone=Qwen3-8B2026.02 | 95 | 3,015 | 31.5 | |
| GSPOBackbone=Qwen3-8B2026.02 | 94.6 | 4,342 | 22.2 | |
| Qwen3-8BBackbone=Qwen3-8B2026.02 | 94.4 | 5,640 | 16.7 | |
| SAGE-GSPOBackbone=Qwen3-8B2026.02 | 94.4 | 2,753 | 34.3 | |
| GRPOBackbone=Qwen3-8B2026.02 | 93.6 | 4,470 | 20.9 | |
| SAGE-GRPOBackbone=DS-7B2026.02 | 93 | 2,141 | 43.4 | |
| GRPOBackbone=DS-7B2026.02 | 92 | 3,219 | 28.5 | |
| DS-7BBackbone=DS-7B2026.02 | 91.6 | 3,871 | 23.7 | |
| Efficient ReasoningBackbone=DS-7B2026.02 | 89.8 | 2,408 | 37.3 | |
| GRPO-LEADBackbone=DS-7B2026.02 | 89.5 | 2,752 | 32.5 | |
| AdaptThinkBackbone=DS-7B2026.02 | 88.9 | 2,199 | 40.4 | |
| SAGE-GRPOBackbone=DeepScaleR2026.02 | 88.8 | 3,117 | 28.4 | |
| GRPOBackbone=DeepScaleR2026.02 | 87.6 | 3,482 | 25.2 | |
| LC-R1Backbone=DS-7B2026.02 | 87.3 | 2,076 | 42.1 | |
| DeepScaleRBackbone=DeepScaleR2026.02 | 86 | 3,805 | 22.6 | |
| SAGE-GSPOBackbone=DS-1.5B2026.02 | 85.2 | 2,921 | 29.2 | |
| SAGE-GRPOBackbone=DS-1.5B2026.02 | 84.8 | 2,915 | 29.1 | |
| GRPOBackbone=DS-1.5B2026.02 | 83.6 | 3,907 | 21.4 | |
| GSPOBackbone=DS-1.5B2026.02 | 83.4 | 3,898 | 25.3 | |
| DS-1.5BBackbone=DS-1.5B2026.02 | 83.2 | 4,882 | 17 | |
| ThinkPrune-2kBackbone=DeepScaleR2026.02 | 82.5 | 2,946 | 28 | |
| Efficient ReasoningBackbone=DS-1.5B2026.02 | 82 | 2,821 | 29.1 | |
| ThinkPrune-2kBackbone=DS-1.5B2026.02 | 81.7 | 2,826 | 28.9 | |
| LC-R1Backbone=DS-1.5B2026.02 | 80.4 | 2,973 | 27 | |
| AdaptThinkBackbone=DS-1.5B2026.02 | 80.4 | 2,563 | 31.4 | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 78 | — | — | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 76.5 | — | — | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 74.1 | — | — | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 71.6 | — | — | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 67.5 | — | — | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 66.8 | — | — | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 66.7 | — | — | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 66.3 | — | — |