Math Reasoning on MATH 500 (mean@16)
91.3Mean@16 AccuracyIRDS
Evaluation Results
| Method | Links | |
|---|---|---|
| IRDSModel=QWEN3-4B, Data Budget=20%2026.05 | 91.3 | |
| LIMRModel=QWEN3-4B, Data Budget=20%2026.05 | 89.1 | |
| PPL-MIDDLEModel=QWEN3-4B, Data Budget=20%2026.05 | 88.9 | |
| DEPOModel=QWEN3-4B, Data Budget=20%2026.05 | 88.8 | |
| PPL-TOPModel=QWEN3-4B, Data Budget=20%2026.05 | 87.3 | |
| IFDModel=QWEN3-4B, Data Budget=20%2026.05 | 86.2 | |
| TOKEN-LENGTHModel=QWEN3-4B, Data Budget=20%2026.05 | 85.3 | |
| RANDOMModel=QWEN3-4B, Data Budget=20%2026.05 | 84.5 | |
| IRDSModel=QWEN3-1.7B, Data Budget=20%2026.05 | 82.5 | |
| LIMRModel=QWEN3-1.7B, Data Budget=20%2026.05 | 79 | |
| DEPOModel=QWEN3-1.7B, Data Budget=20%2026.05 | 77.1 | |
| PPL-MIDDLEModel=QWEN3-1.7B, Data Budget=20%2026.05 | 75.9 | |
| TOKEN-LENGTHModel=QWEN3-1.7B, Data Budget=20%2026.05 | 74.8 | |
| IFDModel=QWEN3-1.7B, Data Budget=20%2026.05 | 74.1 | |
| PPL-TOPModel=QWEN3-1.7B, Data Budget=20%2026.05 | 73.9 | |
| RANDOMModel=QWEN3-1.7B, Data Budget=20%2026.05 | 72.6 | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 55 | |
| RANDOMModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 54.6 | |
| DEPOModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 54 | |
| TOKEN-LENGTHModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 53.3 | |
| PPL-TOPModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 53.1 | |
| IFDModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 53 | |
| LIMRModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 52.6 | |
| PPL-MIDDLEModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 52 |