Reward Modeling on RewardBench OOD Evaluation
99.4ChatFsfairX-Llama3-RM-v0.1
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| FsfairX-Llama3-RM-v0.1Backbone=Llama3, Version=v0.12025.05 | 99.4 | 65.1 | 87.8 | 86.4 | 84.7 | |
| Mutual-TaughtIteration=12025.05 | 98.3 | 63.9 | 85.1 | 95.8 | 85.8 | |
| Mutual-TaughtIteration=22025.05 | 98.2 | 66.3 | 87.8 | 95.7 | 87 | |
| GPT-4o-2024-08-06Version=2024-08-062025.05 | 96.1 | 76.1 | 88.1 | 86.6 | 86.7 |