Mathematical Reasoning on AIME24 (Accuracy, Average Length)
44AccuracyAdaptThink
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AdaptThinkModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 44 | 9,424 | |
| EfficientReasoningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 43.75 | 9,568 | |
| BaseModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 42.67 | 12,723 | |
| Graph-Based Chain-of-Thought PruningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 42.08 | 7,244 | |
| Light-R1-DS-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 39.67 | 12,036 | |
| TokenSkipModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 39.58 | 10,841 | |
| OREAL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 38.75 | 10,907 | |
| Skywork-OR1-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 37.08 | 11,890 | |
| AReaL-boba-RL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 36.67 | 11,407 | |
| O1-PrunerModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 36.67 | 11,191 | |
| BaseModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 30.83 | 11,755 | |
| Graph-Based Chain-of-Thought PruningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 26.67 | 8,278 | |
| EfficientReasoningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 24.17 | 9,380 | |
| AdaptThinkModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 22.08 | 5,129 | |
| O1-PrunerModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 20 | 12,680 | |
| TokenSkipModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 18.33 | 12,635 |