Instruction Following on Dolly Eval
62A Win CountBPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BPOBase LLM=llama-2-chat, Method A=13B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 62 | — | 38 | |
| BPOBase LLM=llama-2-chat, Method A=13B + BPO, Method B=13B, Evaluator=Claude-v1.32023.11 | 57 | — | 43 | |
| BPOBase LLM=vicuna-v1.3, Method A=13B + BPO, Method B=13B, Evaluator=Claude-v1.32023.11 | 56.5 | — | 43.5 | |
| BPOBase LLM=llama-2-chat, Method A=7B + BPO, Method B=7B, Evaluator=Claude-v1.32023.11 | 56 | — | 44 | |
| BPOBase LLM=llama-2-chat, Method A=70B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 56 | — | 44 | |
| BPO-aligned gpt-3.5-turboBase LLM=gpt-3.5-turbo, Evaluator=gpt-42023.11 | 55 | 16 | 29 | |
| BPO-aligned llama-2-13b-chat (scaling test)Base LLM=llama-2-13b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 54 | 6.5 | 39.5 | |
| BPOBase LLM=vicuna-v1.3, Method A=7B + BPO, Method B=7B, Evaluator=Claude-v1.32023.11 | 54 | — | 46 | |
| BPO-aligned llama-2-7b-chatBase LLM=llama-2-7b-chat, Reference Baseline=llama-2-7b-chat original, Evaluator=gpt-42023.11 | 52 | 9.5 | 38.5 | |
| BPO-aligned vicuna-v1.3-13bBase LLM=vicuna-v1.3-13b, Reference Baseline=vicuna-v1.3-13b original, Evaluator=gpt-42023.11 | 52 | 8 | 40 | |
| BPO-aligned gpt-4Base LLM=gpt-4, Evaluator=gpt-42023.11 | 51 | 26 | 23 | |
| BPO-aligned llama-2-70b-chatBase LLM=llama-2-70b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 51 | 18 | 31 | |
| BPOBase LLM=llama-2-chat, Method A=7B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 51 | — | 49 | |
| BPO-aligned llama-2-13b-chatBase LLM=llama-2-13b-chat, Reference Baseline=llama-2-13b-chat original, Evaluator=gpt-42023.11 | 50.5 | 13.5 | 36 | |
| BPO-aligned llama-2-7b-chat (scaling test)Base LLM=llama-2-7b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 49 | 2 | 49 | |
| BPO-aligned vicuna-v1.3-7bBase LLM=vicuna-v1.3-7b, Reference Baseline=vicuna-v1.3-7b original, Evaluator=gpt-42023.11 | 47 | 22 | 31 | |
| BPO-aligned claude-instant-1.2Base LLM=claude-instant-1.2, Evaluator=gpt-42023.11 | 45 | 14.5 | 40.5 | |
| BPO-aligned claude-2Base LLM=claude-2, Evaluator=gpt-42023.11 | 44.5 | 13 | 42.5 | |
| BPO-aligned text-bisonBase LLM=text-bison, Evaluator=gpt-42023.11 | 42 | 30.5 | 27.5 |