Multi-task Language Understanding on MMLU (Average Metrics)
64.29MMLU ScoreLESS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LESSBackbone=Llama-3.1-8B, DATA=5%2025.04 | 64.29 | 62.04 | 12.99 | |
| DEITABackbone=Llama-3.1-8B, DATA=1%2025.04 | 64.19 | 57.98 | -80.25 | |
| RAISEBackbone=Llama-3.1-8B, DATA=1%2025.04 | 64.17 | 59.69 | -40.99 | |
| RAISEBackbone=Llama-3.1-8B, DATA=5%2025.04 | 64.09 | 62.76 | 29.55 | |
| LESSBackbone=Llama-3.1-8B, DATA=1%2025.04 | 64.02 | 59.23 | -51.49 | |
| RANDBackbone=Llama-3.1-8B, DATA=5%2025.04 | 64.02 | 59.87 | -36.97 | |
| DEITABackbone=Llama-3.1-8B, DATA=5%2025.04 | 64.02 | 60.69 | -18.13 | |
| AlpaGasusBackbone=Llama-3.1-8B, DATA=1%2025.04 | 63.79 | 58.34 | -71.92 | |
| AlpaGasusBackbone=Llama-3.1-8B, DATA=5%2025.04 | 63.6 | 59.82 | -38.06 | |
| Full DataBackbone=Llama-3.1-8B, DATA=100%2025.04 | 63.47 | 61.48 | 0 | |
| RANDBackbone=Llama-3.1-8B, DATA=1%2025.04 | 63.47 | 58.3 | -72.84 | |
| IFDBackbone=Llama-3.1-8B, DATA=1%2025.04 | 63.46 | 57.49 | -91.42 | |
| Zero-Shot BaselineBackbone=Llama-3.1-8B, DATA=0%2025.04 | 63.35 | 57.12 | -100 | |
| IFDBackbone=Llama-3.1-8B, DATA=5%2025.04 | 63.15 | 59.51 | -45.1 |