General LLM Evaluation on Open LLM Leaderboard (test)
70.1Average ScoreVicuna-7B-v1.5
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Vicuna-7B-v1.5Base Model=Llama-2-7B, Alignment=SFT, Data Size=125K, Strategy=Best-of-4, zero-shot2024.06 | 70.1 | 71.23 | 89.32 | 67.4 | 52.43 | |
| Deita-7B (UAL)Base Model=Llama-2-7B, Alignment=UAL, Data Size=6K, Strategy=Best-of-4, zero-shot2024.06 | 69.51 | 69.55 | 76.77 | 67.64 | 64.06 | |
| LIMA-7B (UAL)Base Model=Llama-2-7B, Alignment=UAL, Data Size=1K, Strategy=Best-of-4, zero-shot2024.06 | 67.66 | 58.89 | 79.87 | 65.7 | 66.16 | |
| Deita-7B (UAL, PPL Uncertainty)Base Model=Llama-2-7B, Alignment=UAL, Data Size=6K, Strategy=Best-of-4, zero-shot, Alignment with PPL uncertainty=true2024.06 | 66.47 | 66.88 | 75.01 | 63.81 | 60.18 | |
| Deita-7BBase Model=Llama-2-7B, Alignment=SFT, Data Size=6K, Strategy=Best-of-4, zero-shot2024.06 | 65.91 | 67.22 | 74.24 | 64.4 | 57.77 | |
| Alpaca-2-7BBase Model=Llama-2-7B, Alignment=SFT, Data Size=52K, Strategy=Best-of-4, zero-shot2024.06 | 65.38 | 64.54 | 87.04 | 63.68 | 46.26 | |
| Deita-7B (UAL, Mistral)Base Model=Mistral-7B, Alignment=UAL, Data Size=6K, Strategy=Best-of-4, zero-shot2024.06 | 64.9 | 78.26 | 78.93 | 66.16 | 36.23 | |
| LIMA-7BBase Model=Llama-2-7B, Alignment=SFT, Data Size=1K, Strategy=Best-of-4, zero-shot2024.06 | 64.89 | 55.51 | 79.61 | 60.42 | 64.01 | |
| Mistral-7BBase Model=Mistral-7B, Alignment=None, Data Size=None, Strategy=Best-of-4, zero-shot2024.06 | 63.91 | 77.25 | 75.63 | 68.97 | 33.78 | |
| Deita-7B (UAL, PPL Uncertainty, Mistral)Base Model=Mistral-7B, Alignment=UAL, Data Size=6K, Strategy=Best-of-4, zero-shot, Alignment with PPL uncertainty=true2024.06 | 63.79 | 78.92 | 76.86 | 66.08 | 33.29 | |
| Deita-7B (Mistral)Base Model=Mistral-7B, Alignment=SFT, Data Size=6K, Strategy=Best-of-4, zero-shot2024.06 | 61.07 | 71.57 | 71.73 | 62.11 | 38.88 | |
| Llama-2-7BBase Model=Llama-2-7B, Alignment=None, Data Size=None, Strategy=Best-of-4, zero-shot2024.06 | 60.08 | 63.21 | 75.12 | 60.61 | 53.37 | |
| UM-190kTraining Dataset=UM-190k2025.11 | 50.78 | — | — | — | — | |
| UM-187kTraining Dataset=UM-187k2025.11 | 50.57 | — | — | — | — | |
| UM-170kTraining Dataset=UM-170k2025.11 | 49.81 | — | — | — | — | |
| TuluDPOTraining Dataset=TuluDPO2025.11 | 49.78 | — | — | — | — | |
| ORPOTraining Dataset=ORPO2025.11 | 48.95 | — | — | — | — | |
| UltraFBTraining Dataset=UltraFB2025.11 | 48.35 | — | — | — | — | |
| HelpSteerTraining Dataset=HelpSteer2025.11 | 47.09 | — | — | — | — | |
| CodePrefTraining Dataset=CodePref2025.11 | 45.91 | — | — | — | — | |
| SFTTraining Dataset=SFT2025.11 | 45.36 | — | — | — | — |