Knowledge on MMLU (5-shot)
74.01Knowledge (5-shot) ScoreUltraMix-190k
Evaluation Results
| Method | Links | |
|---|---|---|
| UltraMix-190kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-190k2025.11 | 74.01 | |
| UltraMix-187kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-187k2025.11 | 73.92 | |
| UltraMix-170kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-170k2025.11 | 73.53 | |
| TuluDPOBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=TuluDPO2025.11 | 73.1 | |
| SFTBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=SFT2025.11 | 72.41 | |
| UltraMix-190kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-190k2025.11 | 64.61 | |
| UltraMix-187kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-187k2025.11 | 64.19 | |
| TuluDPOBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=TuluDPO2025.11 | 63.47 | |
| UltraMix-170kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-170k2025.11 | 63.27 | |
| SFTBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=SFT2025.11 | 62.3 | |
| UM-190kBase Model=OLMo-2-7B-SFT, DPO Training Dataset=UM-190k2025.11 | 61.92 | |
| UM-187kBase Model=OLMo-2-7B-SFT, DPO Training Dataset=UM-187k2025.11 | 61.51 | |
| TuluDPOBase Model=OLMo-2-7B-SFT, DPO Training Dataset=TuluDPO2025.11 | 61.13 | |
| ORPOBase Model=OLMo-2-7B-SFT, DPO Training Dataset=ORPO2025.11 | 61.07 | |
| UM-170kBase Model=OLMo-2-7B-SFT, DPO Training Dataset=UM-170k2025.11 | 61.04 | |
| UltraFBBase Model=OLMo-2-7B-SFT, DPO Training Dataset=UltraFB2025.11 | 60.95 | |
| CodePrefBase Model=OLMo-2-7B-SFT, DPO Training Dataset=CodePref2025.11 | 60.85 | |
| SFTBase Model=OLMo-2-7B-SFT, DPO Training Dataset=SFT2025.11 | 60.63 | |
| HelpSteerBase Model=OLMo-2-7B-SFT, DPO Training Dataset=HelpSteer2025.11 | 60.62 | |
| Instella-3B-SFT (UM-190k)DPO Training Dataset=UM-190k, Evaluation Protocol=5-shot2025.11 | 58.96 | |
| Instella-3B-SFT (UM-187k)DPO Training Dataset=UM-187k, Evaluation Protocol=5-shot2025.11 | 58.28 | |
| Instella-3B-SFT (TuluDPO)DPO Training Dataset=TuluDPO, Evaluation Protocol=5-shot2025.11 | 58.19 | |
| Instella-3B-SFT (ORPO)DPO Training Dataset=ORPO, Evaluation Protocol=5-shot2025.11 | 57.93 | |
| Instella-3B-SFT (UM-170k)DPO Training Dataset=UM-170k, Evaluation Protocol=5-shot2025.11 | 57.7 | |
| Instella-3B-SFT (HelpSteer)DPO Training Dataset=HelpSteer, Evaluation Protocol=5-shot2025.11 | 57.54 | |
| Instella-3B-SFT (UltraFB)DPO Training Dataset=UltraFB, Evaluation Protocol=5-shot2025.11 | 57.43 | |
| Instella-3B-SFT (CodePref)DPO Training Dataset=CodePref, Evaluation Protocol=5-shot2025.11 | 57.39 | |
| Instella-3B-SFT (SFT)DPO Training Dataset=None (SFT Baseline), Evaluation Protocol=5-shot2025.11 | 57.14 | |
| UltraMixTraining Method=DPO, Dataset=UM-187k, Evaluation Protocol=5-shot2025.11 | 56.9 | |
| UltraMixTraining Method=DPO, Dataset=UM-190k, Evaluation Protocol=5-shot2025.11 | 56.57 | |
| TuluDPOTraining Method=DPO, Dataset=TuluDPO, Evaluation Protocol=5-shot2025.11 | 55.26 | |
| UltraMixTraining Method=DPO, Dataset=UM-170k, Evaluation Protocol=5-shot2025.11 | 55.16 | |
| ORPOTraining Method=ORPO, Dataset=ORPO, Evaluation Protocol=5-shot2025.11 | 54.9 | |
| SmolLM-3-3B-SFTTraining Method=SFT, Evaluation Protocol=5-shot2025.11 | 54.24 | |
| CodePrefTraining Method=DPO, Dataset=CodePref, Evaluation Protocol=5-shot2025.11 | 50.33 | |
| HelpSteerTraining Method=DPO, Dataset=HelpSteer, Evaluation Protocol=5-shot2025.11 | 50.3 | |
| UltraFBTraining Method=DPO, Dataset=UltraFB, Evaluation Protocol=5-shot2025.11 | 50.23 | |
| UM-190kBase Model=OLMo-2-1B-SFT, Training Dataset=UM-190k, Evaluation Protocol=5-shot2025.11 | 42.17 | |
| UM-187kBase Model=OLMo-2-1B-SFT, Training Dataset=UM-187k, Evaluation Protocol=5-shot2025.11 | 42.04 | |
| TuluDPOBase Model=OLMo-2-1B-SFT, Training Dataset=TuluDPO, Evaluation Protocol=5-shot2025.11 | 41.78 | |
| ORPOBase Model=OLMo-2-1B-SFT, Training Dataset=ORPO, Evaluation Protocol=5-shot2025.11 | 41.66 | |
| UM-170kBase Model=OLMo-2-1B-SFT, Training Dataset=UM-170k, Evaluation Protocol=5-shot2025.11 | 41.45 | |
| UltraFBBase Model=OLMo-2-1B-SFT, Training Dataset=UltraFB, Evaluation Protocol=5-shot2025.11 | 41.21 | |
| SFTBase Model=OLMo-2-1B-SFT, Training Dataset=SFT, Evaluation Protocol=5-shot2025.11 | 40.62 | |
| HelpSteerBase Model=OLMo-2-1B-SFT, Training Dataset=HelpSteer, Evaluation Protocol=5-shot2025.11 | 40.54 | |
| CodePrefBase Model=OLMo-2-1B-SFT, Training Dataset=CodePref, Evaluation Protocol=5-shot2025.11 | 40.16 |