Truthfulness on TruthfulQA (TruthfulQA metric)
68.3TruthfulQA ScoreMADS8B
Evaluation Results
| Method | Links | |
|---|---|---|
| MADS8BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 68.3 | |
| FullBase Model=Llama-3-8B, Training Data Scale=100%2026.05 | 65.24 | |
| MADS3BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 65.24 | |
| SelectITBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 64.5 | |
| ClusterClipBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 64.38 | |
| InsTagBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 63.04 | |
| NUGGETSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 61.08 | |
| MADS8BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 60.83 | |
| ClusterClipBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 59.73 | |
| SelectITBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 59.61 | |
| DEITABase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 58.75 | |
| MoDSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 58.07 | |
| InsTagBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 57.28 | |
| MADS3BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 57.16 | |
| FullBase Model=Llama-2-7B, Training Data Scale=100%2026.05 | 56.06 | |
| NUGGETSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 54.71 | |
| DEITABase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 53.98 | |
| MoDSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 52.63 | |
| IFDBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 50.43 | |
| IFDBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 41.62 |