Instruction Following on AlpacaEval, MT-bench, and Vicuna-bench
95.3AlpacaEval Scoregpt-4
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| gpt-4Base Model=Proprietary, Training Method=SFT + RLFT, Size Category=Larger than 13b2023.09 | 95.3 | 82.5 | 90 | 89.3 | |
| llama-2-chat-70bBase Model=llama-2-70b, Training Method=SFT + RLFT, Size Category=Larger than 13b2023.09 | 92.7 | 60 | 87.5 | 80.1 | |
| openchat-13bBase Model=llama-2-13b, Training Method=C-RLFT, Size Category=Equal to 13b2023.09 | 89.5 | 57.5 | 85 | 77.3 | |
| wizardlm-v1.2-13bBase Model=llama-2-13b, Training Method=SFT, Size Category=Equal to 13b2023.09 | 89.2 | 53.1 | 80.6 | 74.3 | |
| claudeBase Model=Proprietary, Training Method=SFT + RLFT, Size Category=Larger than 13b2023.09 | 88.4 | 65 | 76.3 | 76.6 | |
| gpt-3.5-turboBase Model=Proprietary, Training Method=SFT + RLFT, Size Category=Larger than 13b2023.09 | 86.1 | 50 | 50 | 62 | |
| llama-2-chat-13bBase Model=llama-2-13b, Training Method=SFT + RLFT, Size Category=Equal to 13b2023.09 | 81.1 | 55.3 | 86.9 | 74.4 | |
| ultralm-13bBase Model=llama-13b, Training Method=SFT, Size Category=Equal to 13b2023.09 | 80.6 | 37.2 | 50 | 55.9 | |
| vicuna-v1.5-13bBase Model=llama-2-13b, Training Method=SFT, Size Category=Equal to 13b2023.09 | 78.8 | 37.2 | 47.1 | 54.4 | |
| wizardlm-v1.0-13bBase Model=llama-13b, Training Method=SFT, Size Category=Equal to 13b2023.09 | 75.3 | 33.1 | 44.4 | 50.9 | |
| guanaco-65bBase Model=llama-65b, Training Method=SFT, Size Category=Larger than 13b2023.09 | 71.8 | 40.6 | 49.4 | 53.9 | |
| vicuna-v1.1-13bBase Model=llama-13b, Training Method=SFT, Size Category=Equal to 13b2023.09 | 70.4 | 29.4 | 45 | 48.3 | |
| guanaco-33bBase Model=llama-33b, Training Method=SFT, Size Category=Larger than 13b2023.09 | 66 | 40.6 | 54.4 | 53.7 |