Reward-oriented Decoding on Reward-oriented Decoding Evaluation
1.288PPLBo3840
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Bo3840Backbone=Llama-3-8B2024.10 | 1.288 | 1 | |
| Speculative RejectionBackbone=Llama-3-8B, alpha=0.52024.10 | 1.299 | 30.6 | |
| Bo1920Backbone=Llama-3-8B2024.10 | 1.394 | 2 | |
| Speculative RejectionBackbone=Mistral-7B, alpha=0.52024.10 | 1.476 | 76.9 | |
| Bo3840Backbone=Mistral-7B2024.10 | 1.488 | 1 | |
| Bo960Backbone=Llama-3-8B2024.10 | 1.506 | 4 | |
| Speculative RejectionBackbone=Average, alpha=0.52024.10 | 1.554 | 39.9 | |
| Bo480Backbone=Llama-3-8B2024.10 | 1.595 | 8.1 | |
| Bo1920Backbone=Mistral-7B2024.10 | 1.637 | 2 | |
| Bo3840Backbone=Average2024.10 | 1.698 | 1 | |
| Bo960Backbone=Mistral-7B2024.10 | 1.744 | 4 | |
| Bo240Backbone=Llama-3-8B2024.10 | 1.775 | 16 | |
| Bo1920Backbone=Average2024.10 | 1.827 | 2 | |
| Speculative RejectionBackbone=Llama-3-8B-Instruct, alpha=0.52024.10 | 1.887 | 12.1 | |
| Bo480Backbone=Mistral-7B2024.10 | 1.919 | 8 | |
| Bo960Backbone=Average2024.10 | 1.928 | 4 | |
| Bo120Backbone=Llama-3-8B2024.10 | 2.02 | 31.9 | |
| Bo480Backbone=Average2024.10 | 2.044 | 7.9 | |
| Bo240Backbone=Mistral-7B2024.10 | 2.143 | 15.9 | |
| Bo240Backbone=Average2024.10 | 2.212 | 15.9 | |
| Bo120Backbone=Mistral-7B2024.10 | 2.316 | 33.3 | |
| Bo3840Backbone=Llama-3-8B-Instruct2024.10 | 2.318 | 1 | |
| Bo120Backbone=Average2024.10 | 2.407 | 31.6 | |
| Bo1920Backbone=Llama-3-8B-Instruct2024.10 | 2.449 | 2 | |
| Bo960Backbone=Llama-3-8B-Instruct2024.10 | 2.533 | 4.1 | |
| Bo480Backbone=Llama-3-8B-Instruct2024.10 | 2.618 | 7.6 | |
| Bo240Backbone=Llama-3-8B-Instruct2024.10 | 2.718 | 15.9 | |
| Bo120Backbone=Llama-3-8B-Instruct2024.10 | 2.885 | 29.5 |