Mathematical Reasoning on GSM (Accuracy & Average)
92.16GSM AccuracyCRDS-W
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CRDS-WModel=Ling-mini-2.0 (16B), Base Model=Ling-mini-2.0, Truncation Length=2048, Data Selection Ratio=5%, Number of parallel runs=52026.02 | 92.16 | 83.86 | |
| RandomModel=Ling-mini-2.0 (16B), Base Model=Ling-mini-2.0, Truncation Length=2048, Data Selection Ratio=5%, Number of parallel runs=52026.02 | 91.48 | 82.55 | |
| CRDS-RModel=Ling-mini-2.0 (16B), Base Model=Ling-mini-2.0, Truncation Length=2048, Data Selection Ratio=5%, Number of parallel runs=52026.02 | 91.02 | 83.31 | |
| Mid PPLModel=Ling-mini-2.0 (16B), Base Model=Ling-mini-2.0, Truncation Length=2048, Data Selection Ratio=5%, Number of parallel runs=52026.02 | 91.01 | 82.49 | |
| Ling-mini-2.0Model=Ling-mini-2.0 (16B), Base Model=Ling-mini-2.0, Truncation Length=2048, Data Selection Ratio=100%, Number of parallel runs=52026.02 | 90.75 | 83.25 | |
| RDS+Model=Ling-mini-2.0 (16B), Base Model=Ling-mini-2.0, Truncation Length=2048, Data Selection Ratio=5%, Number of parallel runs=52026.02 | 90.55 | 82.28 | |
| LengthModel=Ling-mini-2.0 (16B), Base Model=Ling-mini-2.0, Truncation Length=2048, Data Selection Ratio=5%, Number of parallel runs=52026.02 | 85.05 | 74.53 | |
| MoDSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 61.25 | — | |
| MADS8BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 60.72 | — | |
| InsTagBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 60.65 | — | |
| NUGGETSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 60.5 | — | |
| ClusterClipBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 60.2 | — | |
| MADS3BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 59.89 | — | |
| SelectITBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 59.74 | — | |
| DEITABase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 58.76 | — | |
| IFDBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 58.53 | — | |
| FullBase Model=Llama-3-8B, Training Data Scale=100%2026.05 | 57.92 | — | |
| MADS3BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 19.71 | — | |
| MADS8BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 19.33 | — | |
| ClusterClipBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 18.87 | — | |
| SelectITBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 18.87 | — | |
| InsTagBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 18.87 | — | |
| FullBase Model=Llama-2-7B, Training Data Scale=100%2026.05 | 18.65 | — | |
| MoDSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 17.21 | — | |
| NUGGETSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 17.13 | — | |
| DEITABase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 16.75 | — | |
| IFDBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 15.31 | — |