Long-context evaluation on L-Eval
68.8Close ScoreInternLM2-Chat-20B-SFT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| InternLM2-Chat-20B-SFTModel Scale=13~20B2024.03 | 68.8 | 42 | 49.4 | |
| InternLM2-Chat-7B-SFTModel Scale=< 7B2024.03 | 68.7 | 40.8 | 48.6 | |
| InternLM2-Chat-7BModel Scale=< 7B2024.03 | 68.6 | 40.8 | 48.5 | |
| InternLM2-Chat-20BModel Scale=13~20B2024.03 | 68.6 | 40.6 | 48.4 | |
| Mixtral-8x7B-Instruct-v0.1Model Scale=13~20B2024.03 | 65.3 | 35.6 | 43.9 | |
| ChatGLM3-6BModel Scale=< 7B2024.03 | 59.1 | 35 | 41.7 | |
| Mistral-7B-Instruct-v0.2Model Scale=< 7B2024.03 | 54.3 | 34 | 39.7 | |
| Baichuan2-13B-ChatModel Scale=13~20B2024.03 | 40.6 | 32.3 | 34.6 | |
| Baichuan2-7B-ChatModel Scale=< 7B2024.03 | 36.1 | 32.4 | 33.4 | |
| Qwen-14B-ChatModel Scale=13~20B2024.03 | 35.3 | 33.5 | 34 | |
| Llama2-13B-ChatModel Scale=13~20B2024.03 | 27.3 | 34.4 | 32.5 | |
| Llama2-7B-ChatModel Scale=< 7B2024.03 | 20 | 33.1 | 29.4 | |
| Qwen-7B-ChatModel Scale=< 7B2024.03 | 13.6 | 32.6 | 27.3 |