Reasoning on AIME 25 (avg@k, Token Efficiency)
75.42Avg@kType IV (STOP)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Type IV (STOP)Model=GPT-OSS-20B2026.04 | 75.42 | 191,100 | -71.62 | |
| Type IV (STOP)Model=DS-Qwen-3-8B2026.04 | 72.92 | 290,900 | -79.62 | |
| Type IIModel=DS-Qwen-3-8B2026.04 | 72.5 | 408,400 | -71.39 | |
| No pruning (Baseline)Model=GPT-OSS-20B2026.04 | 70.99 | 673,400 | — | |
| Type IIIModel=GPT-OSS-20B2026.04 | 70.83 | 197,700 | -70.64 | |
| No pruning (Baseline)Model=DS-Qwen-3-8B2026.04 | 70.68 | 1,427,000 | — | |
| Type IIIModel=DS-Qwen-3-8B2026.04 | 70.42 | 291,200 | -79.6 | |
| Type IModel=DS-Qwen-3-8B2026.04 | 69.17 | 297,200 | -79.18 | |
| Type IModel=GPT-OSS-20B2026.04 | 69.17 | 205,100 | -69.54 | |
| Type IIModel=GPT-OSS-20B2026.04 | 69.17 | 311,700 | -53.71 | |
| Type IV (STOP)Model=DS-Qwen-2.5-7B2026.04 | 42.5 | 197,500 | -71.91 | |
| Type IIIModel=DS-Qwen-2.5-7B2026.04 | 41.67 | 202,600 | -71.18 | |
| No pruning (Baseline)Model=DS-Qwen-2.5-7B2026.04 | 39.67 | 703,000 | — | |
| Type IIModel=DS-Qwen-2.5-7B2026.04 | 39.17 | 317,600 | -54.82 | |
| Type IModel=DS-Qwen-2.5-7B2026.04 | 35.42 | 207,400 | -70.5 | |
| Type IV (STOP)Model=DS-Qwen-2.5-1.5B2026.04 | 26.67 | 206,600 | -73.68 | |
| Type IModel=DS-Qwen-2.5-1.5B2026.04 | 24.17 | 214,700 | -72.64 | |
| Type IIModel=DS-Qwen-2.5-1.5B2026.04 | 24.17 | 325,000 | -58.59 | |
| Type IIIModel=DS-Qwen-2.5-1.5B2026.04 | 23.75 | 208,700 | -73.4 | |
| No pruning (Baseline)Model=DS-Qwen-2.5-1.5B2026.04 | 22.76 | 784,800 | — |