Mathematical Reasoning on AIME 25 (Accuracy, Average Length)
31.67AccuracyGraph-Based Chain-of-Thought Pruning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Graph-Based Chain-of-Thought PruningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 31.67 | 6,977 | |
| Light-R1-DS-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 31 | 12,498 | |
| TokenSkipModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 30.83 | 11,259 | |
| EfficientReasoningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 30.83 | 9,293 | |
| AdaptThinkModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 30 | 10,290 | |
| BaseModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 29 | 12,779 | |
| OREAL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 28.75 | 11,309 | |
| O1-PrunerModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 27.5 | 11,475 | |
| AReaL-boba-RL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 25.42 | 12,365 | |
| Skywork-OR1-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 24.67 | 12,831 | |
| Graph-Based Chain-of-Thought PruningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 23.33 | 7,739 | |
| BaseModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 22.92 | 11,797 | |
| EfficientReasoningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 20 | 9,383 | |
| O1-PrunerModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 18.75 | 12,953 | |
| TokenSkipModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 17.92 | 12,630 | |
| AdaptThinkModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 17.5 | 3,854 |