Mathematical Reasoning on AIME25 (Accuracy (Avg@8), Token Usage)
72.9Accuracy (Avg@8)RFTshortest
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RFTshortestBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 72.9 | 21,085 | |
| OriginalBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 72.5 | 21,442 | |
| DPOshortestBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 71.6 | 21,372 | |
| ConPressBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 70.1 | 14,258 | |
| RFTshortestBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 41.7 | 10,541 | |
| OriginalBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 37.9 | 10,643 | |
| ConPressBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 37.5 | 8,698 | |
| LC-R1Backbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 35.8 | 7,339 | |
| AdaptThinkBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 34.2 | 9,525 | |
| DPOshortestBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 32.1 | 8,273 | |
| OriginalBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 22.9 | 12,176 | |
| ConPressBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 22.5 | 8,195 | |
| DPOshortestBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 21.7 | 9,926 | |
| AdaptThinkBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 21.7 | 7,534 | |
| LC-R1Backbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 21.6 | 7,035 | |
| ThinkPruneBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 20.4 | 7,296 | |
| RFTshortestBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 20 | 12,362 |