Mathematical Reasoning on OlympiadBench (Pass@1, Token Usage)
73.3Accuracy (Pass@1)Original
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OriginalBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Pass@12026.02 | 73.3 | 14,857 | |
| RFTshortestBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Pass@12026.02 | 72.6 | 14,317 | |
| ConPressBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Pass@12026.02 | 72.6 | 8,903 | |
| DPOshortestBackbone=Qwen3-4B-Thinking, Evaluation Protocol=Pass@12026.02 | 72 | 13,434 | |
| OriginalBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Pass@12026.02 | 58.7 | 6,898 | |
| ConPressBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Pass@12026.02 | 58.2 | 5,129 | |
| LC-R1Backbone=R1-Distill-Qwen-7B, Evaluation Protocol=Pass@12026.02 | 58.1 | 4,090 | |
| AdaptThinkBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Pass@12026.02 | 57.8 | 5,312 | |
| RFTshortestBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Pass@12026.02 | 56.4 | 7,025 | |
| DPOshortestBackbone=R1-Distill-Qwen-7B, Evaluation Protocol=Pass@12026.02 | 56.1 | 5,385 | |
| ThinkPruneBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Pass@12026.02 | 44.9 | 5,094 | |
| RFTshortestBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Pass@12026.02 | 44.1 | 8,625 | |
| DPOshortestBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Pass@12026.02 | 44.1 | 5,732 | |
| OriginalBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Pass@12026.02 | 43.6 | 8,866 | |
| ConPressBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Pass@12026.02 | 43 | 5,321 | |
| LC-R1Backbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Pass@12026.02 | 42.8 | 4,545 | |
| AdaptThinkBackbone=R1-Distill-Qwen-1.5B, Evaluation Protocol=Pass@12026.02 | 42.8 | 4,808 |