Language Modeling Evaluation on Open LLM Leaderboard
70.22ARCXwin-LM v0.1
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Xwin-LM v0.1Size=70B, Align=dPPO2023.10 | 70.22 | 87.25 | 69.77 | 59.86 | — | |
| Llama2-ChatSize=70B, Align=RLHF2023.10 | 67.32 | 87.33 | 69.83 | 44.92 | — | |
| GuanacoSize=65B, Align=SFT2023.10 | 65.44 | 86.47 | 62.92 | 52.81 | — | |
| WizardLM v1.0Size=70B, Align=dSFT2023.10 | 64.08 | 85.4 | 64.97 | 54.76 | — | |
| Vicuna v1.3Size=33B, Align=dSFT2023.10 | 62.12 | 83 | 59.22 | 56.16 | — | |
| ZephyrSize=7B, Align=dDPO2023.10 | 62.03 | 84.52 | 61.44 | 57.44 | — | |
| Falcon-InstructSize=40B, Align=dSFT2023.10 | 61.6 | 84.31 | 55.45 | 52.52 | — | |
| Xwin-LM v0.1Size=7B, Align=dPPO2023.10 | 56.57 | 79.4 | 49.98 | 47.89 | — | |
| LLaMA-Adapter2023.03 | 54.7 | 78.8 | 34.9 | 40.4 | 52.2 | |
| Mistral-Instruct v0.1Size=7B, Align=dSFT2023.10 | 54.52 | 75.63 | 55.38 | 56.28 | — | |
| Alpaca-LoRA2023.03 | 53 | 77.9 | 37.1 | 34.9 | 50.73 | |
| Alpaca2023.03 | 49.1 | 77.7 | 33.8 | 36.3 | 49.23 | |
| MPT-ChatSize=7B, Align=dSFT2023.10 | 46.5 | 75.51 | 37.62 | 40.16 | — | |
| StableLM-Tuned-aSize=7B, Align=dSFT2023.10 | 31.91 | 53.59 | 24.41 | 40.37 | — |