Aggregate Performance Evaluation on MMLU, GSM, HellaSwag, TruthfulQA, ARC-C, CodeX
5.32ImprovementMADS8B
Evaluation Results
| Method | Links | |
|---|---|---|
| MADS8BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 5.32 | |
| MADS3BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 5.1 | |
| SelectITBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 3.15 | |
| MADS8BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 2.34 | |
| NUGGETSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 1.51 | |
| MADS3BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 1.45 | |
| ClusterClipBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 1.29 | |
| InsTagBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 0.96 | |
| DEITABase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 0.91 | |
| ClusterClipBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 0.86 | |
| InsTagBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 0.71 | |
| MoDSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | -0.27 | |
| SelectITBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | -0.44 | |
| NUGGETSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | -1.51 | |
| MoDSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | -1.57 | |
| DEITABase Model=Llama-3-8B, Training Data Scale=15%2026.05 | -2.51 | |
| IFDBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | -5.36 | |
| IFDBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | -5.67 |