Leaderboard Evaluation on Open LLM Leaderboard 2 (Overall Score)
51.28Overall ScoreUltraMix-190k
Evaluation Results
| Method | Links | |
|---|---|---|
| UltraMix-190kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-190k2025.11 | 51.28 | |
| UltraMix-187kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-187k2025.11 | 50.83 | |
| UltraMix-170kBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=UM-170k2025.11 | 49.74 | |
| TuluDPOBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=TuluDPO2025.11 | 48.53 | |
| SFTBase Model=Qwen-2.5-7B-TuluSFT, Training Mixture/Protocol=SFT2025.11 | 45.77 | |
| UltraMix-190kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-190k2025.11 | 42.75 | |
| UltraMixTraining Method=DPO, Dataset=UM-190k2025.11 | 42.06 | |
| UltraMix-187kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-187k2025.11 | 41.92 | |
| UltraMixTraining Method=DPO, Dataset=UM-187k2025.11 | 41.65 | |
| UltraMix-170kBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=UM-170k2025.11 | 41.02 | |
| TuluDPOTraining Method=DPO, Dataset=TuluDPO2025.11 | 40.68 | |
| TuluDPOBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=TuluDPO2025.11 | 40.66 | |
| UltraMixTraining Method=DPO, Dataset=UM-170k2025.11 | 40.28 | |
| ORPOTraining Method=ORPO, Dataset=ORPO2025.11 | 39.91 | |
| Instella-3B-SFT (UM-190k)DPO Training Dataset=UM-190k2025.11 | 38.42 | |
| UM-190kBackbone=Apertus-8B-SFT2025.11 | 38.36 | |
| Instella-3B-SFT (UM-187k)DPO Training Dataset=UM-187k2025.11 | 38.01 | |
| UM-187kBackbone=Apertus-8B-SFT2025.11 | 37.93 | |
| SmolLM-3-3B-SFTTraining Method=SFT2025.11 | 37.72 | |
| Instella-3B-SFT (UM-170k)DPO Training Dataset=UM-170k2025.11 | 37.32 | |
| SFTBase Model=Llama-3.1-8B-TuluSFT, Training Mixture/Protocol=SFT2025.11 | 37.15 | |
| Instella-3B-SFT (TuluDPO)DPO Training Dataset=TuluDPO2025.11 | 37.14 | |
| UM-170kBackbone=Apertus-8B-SFT2025.11 | 36.94 | |
| TuluDPOBackbone=Apertus-8B-SFT2025.11 | 36.76 | |
| HelpSteerTraining Method=DPO, Dataset=HelpSteer2025.11 | 36.5 | |
| UltraFBBackbone=Apertus-8B-SFT2025.11 | 36.36 | |
| Instella-3B-SFT (ORPO)DPO Training Dataset=ORPO2025.11 | 36.25 | |
| ORPOBackbone=Apertus-8B-SFT2025.11 | 35.95 | |
| UltraFBTraining Method=DPO, Dataset=UltraFB2025.11 | 35.94 | |
| HelpSteerBackbone=Apertus-8B-SFT2025.11 | 35.43 | |
| Instella-3B-SFT (HelpSteer)DPO Training Dataset=HelpSteer2025.11 | 35.11 | |
| Instella-3B-SFT (SFT)DPO Training Dataset=None (SFT Baseline)2025.11 | 34.89 | |
| Instella-3B-SFT (UltraFB)DPO Training Dataset=UltraFB2025.11 | 34.88 | |
| CodePrefTraining Method=DPO, Dataset=CodePref2025.11 | 34.7 | |
| Instella-3B-SFT (CodePref)DPO Training Dataset=CodePref2025.11 | 34.38 | |
| SFTBackbone=Apertus-8B-SFT2025.11 | 34.21 | |
| CodePrefBackbone=Apertus-8B-SFT2025.11 | 34.02 | |
| UM-190kTraining Dataset=UM-190k2025.11 | 31.07 | |
| UM-187kTraining Dataset=UM-187k2025.11 | 30.91 | |
| UM-190k2025.11 | 30.67 | |
| UM-170kTraining Dataset=UM-170k2025.11 | 30.18 | |
| UM-187k2025.11 | 30.15 | |
| TuluDPOTraining Dataset=TuluDPO2025.11 | 30.02 | |
| TuluDPO2025.11 | 29.3 | |
| ORPOTraining Dataset=ORPO2025.11 | 29.13 | |
| ORPO2025.11 | 29.13 | |
| UM-170k2025.11 | 28.64 | |
| UltraFBTraining Dataset=UltraFB2025.11 | 28.52 | |
| SFT2025.11 | 28.39 | |
| UltraFB2025.11 | 28.2 | |
| HelpSteerTraining Dataset=HelpSteer2025.11 | 27.85 | |
| CodePrefTraining Dataset=CodePref2025.11 | 27.65 | |
| HelpSteer2025.11 | 27.56 | |
| SFTTraining Dataset=SFT2025.11 | 27.31 | |
| CodePref2025.11 | 26.03 |