Open-ended Generation on AlpacaEval 1.0
7,904Win RateLLAMA-2-CHAT
Evaluation Results
| Method | Links | |
|---|---|---|
| LLAMA-2-CHATBackbone=LLAMA-2-7B-BASE2024.05 | 7,904 | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less BBH ICL, Number of training examples=13,5332024.05 | 4,415 | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less BBH ICL, Number of training examples=13,5332024.05 | 3,981 | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less BBH ICL, Number of training examples=13,5332024.05 | 3,620 | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=LIMA, Number of training examples=1,0302024.05 | 3,306 | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=LIMA, Number of training examples=1,0302024.05 | 3,294 | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 9k, Number of training examples=9,2292024.05 | 3,161 | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 9k, Number of training examples=9,2292024.05 | 3,077 | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=LIMA, Number of training examples=1,0302024.05 | 3,051 | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 9k, Number of training examples=9,2292024.05 | 2,154 | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Alpaca 5k, Number of training examples=5,3052024.05 | 2,137 | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Alpaca 5k, Number of training examples=5,3052024.05 | 1,952 | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Alpaca 5k, Number of training examples=5,3052024.05 | 1,629 | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 3k, Number of training examples=2,9962024.05 | 1,511 | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 3k, Number of training examples=2,9962024.05 | 1,404 | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 3k, Number of training examples=2,9962024.05 | 1,342 | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less Tydiqa, Number of training examples=13,5332024.05 | 1,010 | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less MMLU Chat, Number of training examples=13,5332024.05 | 978 | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less Tydiqa, Number of training examples=13,5332024.05 | 835 | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less MMLU Chat, Number of training examples=13,5332024.05 | 622 | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less Tydiqa, Number of training examples=13,5332024.05 | 512 | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less MMLU Chat, Number of training examples=13,5332024.05 | 442 | |
| LLAMA-2-BASEBackbone=LLAMA-2-7B-BASE2024.05 | 1 |