Mathematical Reasoning on AIME 2024 (Pass@1, LEN, TE)
73.7Pass@1SAGE-GSPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SAGE-GSPOBackbone=Qwen3-8B2026.02 | 73.7 | 8,547 | 8.62 | |
| SAGE-GRPOBackbone=Qwen3-8B2026.02 | 73.5 | 8,975 | 8.19 | |
| Qwen3-8BBackbone=Qwen3-8B2026.02 | 73.2 | 15,920 | 4.6 | |
| GSPOBackbone=Qwen3-8B2026.02 | 73 | 10,544 | 6.92 | |
| GRPOBackbone=Qwen3-8B2026.02 | 72.8 | 10,573 | 6.89 | |
| SAGE-GRPOBackbone=DS-7B2026.02 | 55.3 | 6,422 | 8.61 | |
| GRPO-LEADBackbone=DS-7B2026.02 | 53.1 | 7,023 | 7.56 | |
| GRPOBackbone=DS-7B2026.02 | 52.5 | 8,424 | 6.23 | |
| AdaptThinkBackbone=DS-7B2026.02 | 52.1 | 6,679 | 7.8 | |
| SafePathModel Size=7B, Sampling trajectories=82026.01 | 52.08 | — | — | |
| DS-7BBackbone=DS-7B2026.02 | 51.9 | 11,305 | 4.59 | |
| Efficient ReasoningBackbone=DS-7B2026.02 | 51.9 | 6,667 | 7.78 | |
| LC-R1Backbone=DS-7B2026.02 | 51.7 | 6,820 | 7.58 | |
| THINKSAFEModel Size=7B, Sampling trajectories=82026.01 | 51.25 | — | — | |
| InitialModel Size=7B, Sampling trajectories=82026.01 | 49.58 | — | — | |
| SafeChainModel Size=7B, Sampling trajectories=82026.01 | 49.17 | — | — | |
| THINKSAFEModel Size=8B, Sampling trajectories=82026.01 | 48.75 | — | — | |
| DirectRefusalModel Size=7B, Sampling trajectories=82026.01 | 47.5 | — | — | |
| InitialModel Size=8B, Sampling trajectories=82026.01 | 47.5 | — | — | |
| STAR-1Model Size=7B, Sampling trajectories=82026.01 | 45.83 | — | — | |
| SafeKeyModel Size=7B, Sampling trajectories=82026.01 | 43.75 | — | — | |
| SafePathModel Size=8B, Sampling trajectories=82026.01 | 43.33 | — | — | |
| SafeChainModel Size=8B, Sampling trajectories=82026.01 | 41.67 | — | — | |
| STAR-1Model Size=8B, Sampling trajectories=82026.01 | 40.42 | — | — | |
| DirectRefusalModel Size=8B, Sampling trajectories=82026.01 | 40 | — | — | |
| SAGE-GRPOBackbone=DeepScaleR2026.02 | 36.1 | 8,094 | 4.46 | |
| SafeKeyModel Size=8B, Sampling trajectories=82026.01 | 35.83 | — | — | |
| GRPOBackbone=DeepScaleR2026.02 | 35.6 | 8,592 | 4.14 | |
| ThinkPrune-2kBackbone=DeepScaleR2026.02 | 33.5 | 8,108 | 4.13 | |
| THINKSAFEModel Size=1.5B, Sampling trajectories=82026.01 | 32.92 | — | — | |
| DeepScaleRBackbone=DeepScaleR2026.02 | 31.4 | 9,370 | 3.35 | |
| SAGE-GRPOBackbone=DS-1.5B2026.02 | 28.8 | 7,243 | 3.98 | |
| SAGE-GSPOBackbone=DS-1.5B2026.02 | 28.5 | 6,889 | 4.14 | |
| GRPOBackbone=DS-1.5B2026.02 | 28.3 | 8,767 | 3.23 | |
| GSPOBackbone=DS-1.5B2026.02 | 28.3 | 8,604 | 3.29 | |
| Efficient ReasoningBackbone=DS-1.5B2026.02 | 26.2 | 9,189 | 2.85 | |
| AdaptThinkBackbone=DS-1.5B2026.02 | 25.7 | 8,055 | 3.19 | |
| DS-1.5BBackbone=DS-1.5B2026.02 | 25.1 | 12,300 | 2.04 | |
| SafeChainModel Size=1.5B, Sampling trajectories=82026.01 | 24.17 | — | — | |
| SafePathModel Size=1.5B, Sampling trajectories=82026.01 | 24.17 | — | — | |
| ThinkPrune-2kBackbone=DS-1.5B2026.02 | 23.7 | 7,085 | 3.35 | |
| LC-R1Backbone=DS-1.5B2026.02 | 23.3 | 7,098 | 3.28 | |
| InitialModel Size=1.5B, Sampling trajectories=82026.01 | 21.25 | — | — | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 20.6 | — | — | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 20.3 | — | — | |
| SafeKeyModel Size=1.5B, Sampling trajectories=82026.01 | 19.58 | — | — | |
| DirectRefusalModel Size=1.5B, Sampling trajectories=82026.01 | 19.17 | — | — | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 17.2 | — | — | |
| STAR-1Model Size=1.5B, Sampling trajectories=82026.01 | 17.08 | — | — | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 15.7 | — | — | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 11.8 | — | — | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 11.2 | — | — | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 10.5 | — | — | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 10.2 | — | — |