Instruction Following on BPO Eval (test)
59.5A WinsBPO-aligned vicuna-v1.3-13b
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BPO-aligned vicuna-v1.3-13bBase LLM=vicuna-v1.3-13b, Reference Baseline=vicuna-v1.3-13b original, Evaluator=gpt-42023.11 | 59.5 | 6 | 34.5 | |
| BPOBase LLM=llama-2-chat, Method A=7B + BPO, Method B=7B, Evaluator=Claude-v1.32023.11 | 58 | — | 42 | |
| BPOBase LLM=llama-2-chat, Method A=13B + BPO, Method B=13B, Evaluator=Claude-v1.32023.11 | 57.5 | — | 42.5 | |
| BPOBase LLM=vicuna-v1.3, Method A=13B + BPO, Method B=13B, Evaluator=Claude-v1.32023.11 | 57.5 | — | 42.5 | |
| BPO-aligned llama-2-70b-chatBase LLM=llama-2-70b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 53.5 | 11 | 35.5 | |
| BPOBase LLM=llama-2-chat, Method A=13B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 53.5 | — | 46.5 | |
| BPO-aligned llama-2-7b-chatBase LLM=llama-2-7b-chat, Reference Baseline=llama-2-7b-chat original, Evaluator=gpt-42023.11 | 53 | 10.5 | 36.5 | |
| BPO-aligned llama-2-13b-chatBase LLM=llama-2-13b-chat, Reference Baseline=llama-2-13b-chat original, Evaluator=gpt-42023.11 | 53 | 12.5 | 34.5 | |
| BPOBase LLM=vicuna-v1.3, Method A=7B + BPO, Method B=7B, Evaluator=Claude-v1.32023.11 | 53 | — | 47 | |
| BPOBase LLM=llama-2-chat, Method A=70B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 52.5 | — | 47.5 | |
| BPO-aligned gpt-3.5-turboBase LLM=gpt-3.5-turbo, Evaluator=gpt-42023.11 | 51 | 18 | 31 | |
| BPO-aligned llama-2-13b-chat (scaling test)Base LLM=llama-2-13b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 51 | 7 | 42 | |
| BPOBase LLM=llama-2-chat, Method A=7B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 51 | — | 49 | |
| BPO-aligned text-bisonBase LLM=text-bison, Evaluator=gpt-42023.11 | 50.5 | 10.5 | 39 | |
| BPO-aligned vicuna-v1.3-7bBase LLM=vicuna-v1.3-7b, Reference Baseline=vicuna-v1.3-7b original, Evaluator=gpt-42023.11 | 46 | 22 | 32 | |
| BPO-aligned claude-instant-1.2Base LLM=claude-instant-1.2, Evaluator=gpt-42023.11 | 45 | 10.5 | 44.5 | |
| BPO-aligned claude-2Base LLM=claude-2, Evaluator=gpt-42023.11 | 45 | 13 | 42 | |
| BPO-aligned llama-2-7b-chat (scaling test)Base LLM=llama-2-7b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 40 | 5 | 55 | |
| BPO-aligned gpt-4Base LLM=gpt-4, Evaluator=gpt-42023.11 | 39 | 26 | 35 |