Reward Modeling on PRISM Full (test)
61.11Chile ScoreSCPO (F + W)
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| SCPO (F + W)Backbone=OpenAssistant RM2026.06 | 61.11 | 60.38 | 61.93 | 59.2 | 67.65 | 64.32 | 64.45 | 62.72 | |
| BaselineBackbone=OpenAssistant RM2026.06 | 60.03 | 61.8 | 62.58 | 59.93 | 60.93 | 65.96 | 63.58 | 62.12 | |
| Inverse Weighted OnlyBackbone=OpenAssistant RM2026.06 | 60.03 | 50.77 | 60.72 | 47.53 | 60.35 | 55.99 | 60.98 | 56.62 | |
| SCPO (F + W)tunedBackbone=OpenAssistant RM2026.06 | 59.89 | 64.17 | 62.3 | 60.26 | 63.39 | 67.84 | 66.09 | 63.42 | |
| SCPO (W)Backbone=OpenAssistant RM2026.06 | 58.94 | 64.77 | 58.96 | 60.18 | 56.8 | 65.61 | 62.62 | 61.13 | |
| Global RMBackbone=OpenAssistant RM2026.06 | 54.54 | 64.06 | 56.55 | 59.61 | 51.64 | 63.03 | 60.4 | 58.55 | |
| Filtered OnlyBackbone=OpenAssistant RM2026.06 | 51.59 | 39.62 | 52.83 | 41.77 | 52.88 | 39.67 | 49.71 | 46.87 |