Math Reasoning on AIME 2025 (mean@16 %)
35.6Mean Score (AIME 2025)IRDS
Evaluation Results
| Method | Links | |
|---|---|---|
| IRDSModel=QWEN3-4B, Data Budget=20%2026.05 | 35.6 | |
| DEPOModel=QWEN3-4B, Data Budget=20%2026.05 | 29 | |
| IFDModel=QWEN3-4B, Data Budget=20%2026.05 | 28.1 | |
| PPL-TOPModel=QWEN3-4B, Data Budget=20%2026.05 | 27.9 | |
| LIMRModel=QWEN3-4B, Data Budget=20%2026.05 | 27.7 | |
| PPL-MIDDLEModel=QWEN3-4B, Data Budget=20%2026.05 | 25.6 | |
| IRDSModel=QWEN3-1.7B, Data Budget=20%2026.05 | 22.5 | |
| RANDOMModel=QWEN3-4B, Data Budget=20%2026.05 | 21.9 | |
| TOKEN-LENGTHModel=QWEN3-4B, Data Budget=20%2026.05 | 20.2 | |
| DEPOModel=QWEN3-1.7B, Data Budget=20%2026.05 | 15.4 | |
| RANDOMModel=QWEN3-1.7B, Data Budget=20%2026.05 | 14.6 | |
| LIMRModel=QWEN3-1.7B, Data Budget=20%2026.05 | 13.5 | |
| PPL-MIDDLEModel=QWEN3-1.7B, Data Budget=20%2026.05 | 12.7 | |
| TOKEN-LENGTHModel=QWEN3-1.7B, Data Budget=20%2026.05 | 12.3 | |
| IFDModel=QWEN3-1.7B, Data Budget=20%2026.05 | 10.8 | |
| PPL-TOPModel=QWEN3-1.7B, Data Budget=20%2026.05 | 9.2 | |
| RANDOMModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 1.7 | |
| IFDModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 1.7 | |
| DEPOModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 1 | |
| LIMRModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 0.8 | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 0.8 | |
| TOKEN-LENGTHModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 0.6 | |
| PPL-MIDDLEModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 0.6 | |
| PPL-TOPModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 0.2 |