Reward Model Evaluation on Alpaca-Eval
72.59LC Win RateFiMi-RM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| FiMi-RMBackbone=Qwen2.5-7B, Algorithm=BoN2025.05 | 72.59 | 76.39 | 543 | 125 | |
| ODINBackbone=Qwen2.5-7B, Algorithm=BoN2025.05 | 71.38 | 75.58 | 512 | 115 | |
| Length PenaltyBackbone=Qwen2.5-7B, Algorithm=BoN2025.05 | 69.22 | 74.54 | 620 | 144 | |
| Vanilla RMBackbone=Qwen2.5-7B, Algorithm=BoN2025.05 | 68.25 | 73.84 | 638 | 148 | |
| FiMi-RMBackbone=Gemma2-9B, Algorithm=BoN2025.05 | 66.68 | 67.77 | 534 | 123 | |
| ODINBackbone=Gemma2-9B, Algorithm=BoN2025.05 | 63.46 | 65.24 | 684 | 168 | |
| Vanilla RMBackbone=Gemma2-9B, Algorithm=BoN2025.05 | 62.91 | 65.77 | 756 | 179 | |
| Length PenaltyBackbone=Gemma2-9B, Algorithm=BoN2025.05 | 62.69 | 65.62 | 712 | 158 |