Mathematical Reasoning on OlympiadBench (Pass@1, LEN, TE)
62.1Pass@1GPS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPSBackbone=DeepSeek-R1-Distill-7B, Strategy=GPS, Runtime=49h2026.02 | 62.1 | — | — | |
| Dynamic Sampling (Oracle)Backbone=DeepSeek-R1-Distill-7B, Strategy=DS, Runtime=77h2026.02 | 60 | — | — | |
| MoPPSBackbone=DeepSeek-R1-Distill-7B, Strategy=MoPPS, Runtime=42h2026.02 | 58.3 | — | — | |
| GRESOBackbone=DeepSeek-R1-Distill-7B, Strategy=GRESO, Runtime=53h2026.02 | 58.2 | — | — | |
| PCLBackbone=DeepSeek-R1-Distill-7B, Strategy=PCL, Runtime=50h2026.02 | 58 | — | — | |
| Uniform SamplingBackbone=DeepSeek-R1-Distill-7B, Strategy=Uniform, Runtime=40h2026.02 | 57.9 | — | — | |
| GPSBackbone=DeepSeek-R1-Distill-1.5B, Strategy=GPS, Runtime=16h2026.02 | 51.3 | — | — | |
| Dynamic Sampling (Oracle)Backbone=DeepSeek-R1-Distill-1.5B, Strategy=DS, Runtime=30h2026.02 | 51 | — | — | |
| GRESOBackbone=DeepSeek-R1-Distill-1.5B, Strategy=GRESO, Runtime=27h2026.02 | 50.6 | — | — | |
| PCLBackbone=DeepSeek-R1-Distill-1.5B, Strategy=PCL, Runtime=17h2026.02 | 49.6 | — | — | |
| Uniform SamplingBackbone=DeepSeek-R1-Distill-1.5B, Strategy=Uniform, Runtime=16h2026.02 | 49 | — | — | |
| MoPPSBackbone=DeepSeek-R1-Distill-1.5B, Strategy=MoPPS, Runtime=17h2026.02 | 49 | — | — | |
| DeepSeek-R1-Distill-7BBackbone=DeepSeek-R1-Distill-7B, Strategy=Base2026.02 | 47.5 | — | — | |
| SAGE-GSPOBackbone=Qwen3-8B2026.02 | 46.7 | 5,436 | 8.59 | |
| Qwen3-8BBackbone=Qwen3-8B2026.02 | 46.6 | 11,707 | 4 | |
| GSPOBackbone=Qwen3-8B2026.02 | 46.6 | 7,964 | 5.85 | |
| SAGE-GRPOBackbone=Qwen3-8B2026.02 | 45.4 | 5,972 | 7.6 | |
| GRPOBackbone=Qwen3-8B2026.02 | 45.1 | 7,512 | 6 | |
| SAGE-GRPOBackbone=DS-7B2026.02 | 41.8 | 4,435 | 9.42 | |
| LC-R1Backbone=DS-7B2026.02 | 41.4 | 4,193 | 9.87 | |
| GRPOBackbone=DS-7B2026.02 | 41.2 | 5,498 | 7.5 | |
| GRPO-LEADBackbone=DS-7B2026.02 | 40.6 | 4,972 | 8.17 | |
| Efficient ReasoningBackbone=DS-7B2026.02 | 40.1 | 4,599 | 8.72 | |
| DS-7BBackbone=DS-7B2026.02 | 39.8 | 7,839 | 5.08 | |
| AdaptThinkBackbone=DS-7B2026.02 | 38.9 | 4,915 | 7.91 | |
| SAGE-GSPOBackbone=DS-1.5B2026.02 | 37.3 | 5,172 | 7.21 | |
| SAGE-GRPOBackbone=DS-1.5B2026.02 | 36.9 | 5,050 | 7.31 | |
| DeepSeek-R1-Distill-1.5BBackbone=DeepSeek-R1-Distill-1.5B, Strategy=Base2026.02 | 36.6 | — | — | |
| SAGE-GRPOBackbone=DeepScaleR2026.02 | 36.5 | 4,890 | 7.46 | |
| GRPOBackbone=DeepScaleR2026.02 | 36.2 | 5,443 | 6.65 | |
| DeepScaleRBackbone=DeepScaleR2026.02 | 35.9 | 5,972 | 6.01 | |
| ThinkPrune-2kBackbone=DeepScaleR2026.02 | 35.1 | 4,723 | 7.43 | |
| GSPOBackbone=DS-1.5B2026.02 | 34.6 | 6,410 | 5.4 | |
| GRPOBackbone=DS-1.5B2026.02 | 34.2 | 6,323 | 5.41 | |
| Efficient ReasoningBackbone=DS-1.5B2026.02 | 33.8 | 5,755 | 5.87 | |
| DS-1.5BBackbone=DS-1.5B2026.02 | 33.4 | 8,954 | 3.73 | |
| ThinkPrune-2kBackbone=DS-1.5B2026.02 | 32.9 | 4,752 | 6.92 | |
| AdaptThinkBackbone=DS-1.5B2026.02 | 32.6 | 4,563 | 7.14 | |
| LC-R1Backbone=DS-1.5B2026.02 | 32 | 4,632 | 6.91 |