Knowledge on TruthfulQA 0-shot
63.85AccuracyUltraMix-187k
Evaluation Results
| Method | Links | |
|---|---|---|
| UltraMix-187kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-187k2025.11 | 63.85 | |
| UltraMix-190kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-190k2025.11 | 63.32 | |
| UltraMix-170kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-170k2025.11 | 61.45 | |
| UltraMixTraining Method=DPO, Dataset=UM-190k, Evaluation Protocol=0-shot2025.11 | 60.57 | |
| TuluDPOTraining Method=DPO, Dataset=TuluDPO, Evaluation Protocol=0-shot2025.11 | 60.28 | |
| UltraMixTraining Method=DPO, Dataset=UM-187k, Evaluation Protocol=0-shot2025.11 | 60.25 | |
| UltraMixTraining Method=DPO, Dataset=UM-170k, Evaluation Protocol=0-shot2025.11 | 59.05 | |
| ORPOTraining Method=ORPO, Dataset=ORPO, Evaluation Protocol=0-shot2025.11 | 58.46 | |
| UltraMix-187kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-187k2025.11 | 58.24 | |
| UltraMix-190kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-190k2025.11 | 58 | |
| UltraMix-170kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-170k2025.11 | 57.6 | |
| TuluDPOBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=TuluDPO2025.11 | 56.78 | |
| TuluDPOBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=TuluDPO2025.11 | 54.46 | |
| SmolLM-3-3B-SFTTraining Method=SFT, Evaluation Protocol=0-shot2025.11 | 52.14 | |
| SFTBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=SFT2025.11 | 51.64 | |
| CodePrefTraining Method=DPO, Dataset=CodePref, Evaluation Protocol=0-shot2025.11 | 49.79 | |
| HelpSteerTraining Method=DPO, Dataset=HelpSteer, Evaluation Protocol=0-shot2025.11 | 49.33 | |
| UltraFBTraining Method=DPO, Dataset=UltraFB, Evaluation Protocol=0-shot2025.11 | 49.21 | |
| SFTBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=SFT2025.11 | 46.84 | |
| UM-190kTraining Dataset=UM-190k2025.11 | 44.86 | |
| UM-187kTraining Dataset=UM-187k2025.11 | 44.63 | |
| UM-170kTraining Dataset=UM-170k2025.11 | 44.51 | |
| TuluDPOTraining Dataset=TuluDPO2025.11 | 44.4 | |
| ORPOTraining Dataset=ORPO2025.11 | 44.34 | |
| HelpSteerTraining Dataset=HelpSteer2025.11 | 43.75 | |
| UltraFBTraining Dataset=UltraFB2025.11 | 43.67 | |
| SFTTraining Dataset=SFT2025.11 | 42.07 | |
| CodePrefTraining Dataset=CodePref2025.11 | 41.63 |