Mathematical Reasoning on MATH 500 (Accuracy, Average Length)
89.16AccuracyBase
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BaseModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 89.16 | 3,065 | |
| OREAL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 88.83 | 3,023 | |
| Graph-Based Chain-of-Thought PruningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 88.8 | 2,080 | |
| Light-R1-DS-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 87.58 | 3,020 | |
| AdaptThinkModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 87.23 | 1,603 | |
| AReaL-boba-RL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 87.12 | 3,904 | |
| Skywork-OR1-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 85.96 | 3,753 | |
| EfficientReasoningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 82.25 | 1,392 | |
| EfficientReasoningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 81.5 | 1,600 | |
| Graph-Based Chain-of-Thought PruningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 80.4 | 1,798 | |
| AdaptThinkModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 78.9 | 987 | |
| TokenSkipModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 77.56 | 2,115 | |
| O1-PrunerModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 76.62 | 2,812 | |
| BaseModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 72.65 | 2,822 | |
| TokenSkipModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 72.31 | 3,139 | |
| O1-PrunerModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 66.81 | 3,291 |