Mathematical Reasoning on AMC (Avg@8 and Token Usage)
99.6Accuracy (Avg@8)RFTshortest
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RFTshortestBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 99.6 | 10,137 | |
| OriginalBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 99.1 | 10,772 | |
| ConPressBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 98.8 | 4,482 | |
| DPOshortestBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Avg@82026.02 | 97.5 | 9,309 | |
| OriginalBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 88.1 | 5,346 | |
| RFTshortestBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 87.5 | 5,417 | |
| ConPressBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 87.2 | 3,459 | |
| DPOshortestBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 86.5 | 3,463 | |
| AdaptThinkBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 85.9 | 3,483 | |
| LC-R1Backbone=R1-Distill-Qwen-7B, Evaluation Protocol=Avg@82026.02 | 82.5 | 2,862 | |
| DPOshortestBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 68.7 | 5,633 | |
| OriginalBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 67.8 | 7,748 | |
| RFTshortestBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 67.8 | 7,275 | |
| AdaptThinkBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 66.3 | 3,027 | |
| ConPressBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 66.3 | 5,442 | |
| LC-R1Backbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 66.2 | 3,727 | |
| ThinkPruneBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Avg@82026.02 | 65 | 4,231 |