Best-of-N Reward Evaluation on UltraFeedback core250
24.323Reward ScoreTEA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TEAN=256, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 24.323 | 1.102 | |
| TEAN=128, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 23.342 | 1.067 | |
| GRPON=256, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 23.221 | — | |
| GRPON=128, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 22.275 | — | |
| TEAN=64, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 22.09 | 0.835 | |
| GRPON=64, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 21.255 | — | |
| TEAN=32, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 20.858 | 0.701 | |
| GRPON=32, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 20.157 | — | |
| TEAN=16, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 19.522 | 0.589 | |
| GRPON=16, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 18.933 | — | |
| TEAN=8, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 18.014 | 0.485 | |
| GRPON=8, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 17.529 | — | |
| TEAN=4, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 16.322 | 0.383 | |
| GRPON=4, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 15.939 | — | |
| TEAN=2, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 14.493 | 0.469 | |
| GRPON=2, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 14.024 | — | |
| TEAN=1, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 12.081 | 0.441 | |
| GRPON=1, Backbone=Llama-3.1-8B-Instruct, Training Mode=LoRA2026.05 | 11.64 | — |