Instruction Following on Self-instruct Eval
56.7Win Rate (A)BPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BPOBase LLM=vicuna-v1.3, Method A=7B + BPO, Method B=7B, Evaluator=Claude-v1.32023.11 | 56.7 | — | 43.3 | |
| BPOBase LLM=llama-2-chat, Method A=13B + BPO, Method B=13B, Evaluator=Claude-v1.32023.11 | 56.3 | — | 43.7 | |
| BPOBase LLM=llama-2-chat, Method A=13B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 55.6 | — | 44.4 | |
| BPOBase LLM=vicuna-v1.3, Method A=13B + BPO, Method B=13B, Evaluator=Claude-v1.32023.11 | 54 | — | 46 | |
| BPOBase LLM=llama-2-chat, Method A=70B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 52.4 | — | 47.6 | |
| BPOBase LLM=llama-2-chat, Method A=7B + BPO, Method B=7B, Evaluator=Claude-v1.32023.11 | 52 | — | 48 | |
| BPOBase LLM=llama-2-chat, Method A=7B + BPO, Method B=70B, Evaluator=Claude-v1.32023.11 | 48 | — | 52 | |
| BPO-aligned llama-2-7b-chatBase LLM=llama-2-7b-chat, Reference Baseline=llama-2-7b-chat original, Evaluator=gpt-42023.11 | 0.536 | 0.099 | 0.365 | |
| BPO-aligned llama-2-13b-chatBase LLM=llama-2-13b-chat, Reference Baseline=llama-2-13b-chat original, Evaluator=gpt-42023.11 | 0.512 | 0.119 | 0.369 | |
| BPO-aligned gpt-3.5-turboBase LLM=gpt-3.5-turbo, Evaluator=gpt-42023.11 | 0.504 | 0.123 | 0.373 | |
| BPO-aligned claude-instant-1.2Base LLM=claude-instant-1.2, Evaluator=gpt-42023.11 | 0.5 | 0.091 | 0.409 | |
| BPO-aligned claude-2Base LLM=claude-2, Evaluator=gpt-42023.11 | 0.488 | 0.127 | 0.385 | |
| BPO-aligned llama-2-13b-chat (scaling test)Base LLM=llama-2-13b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 0.484 | 0.048 | 0.468 | |
| BPO-aligned text-bisonBase LLM=text-bison, Evaluator=gpt-42023.11 | 0.47 | 0.219 | 0.311 | |
| BPO-aligned vicuna-v1.3-13bBase LLM=vicuna-v1.3-13b, Reference Baseline=vicuna-v1.3-13b original, Evaluator=gpt-42023.11 | 0.464 | 0.139 | 0.397 | |
| BPO-aligned llama-2-70b-chatBase LLM=llama-2-70b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 0.46 | 0.131 | 0.409 | |
| BPO-aligned vicuna-v1.3-7bBase LLM=vicuna-v1.3-7b, Reference Baseline=vicuna-v1.3-7b original, Evaluator=gpt-42023.11 | 0.42 | 0.211 | 0.369 | |
| BPO-aligned llama-2-7b-chat (scaling test)Base LLM=llama-2-7b-chat, Reference Baseline=llama-2-70b-chat original, Evaluator=gpt-42023.11 | 0.401 | 0.051 | 0.548 | |
| BPO-aligned gpt-4Base LLM=gpt-4, Evaluator=gpt-42023.11 | 0.397 | 0.226 | 0.377 |