Reward Modeling on PKU-SafeRLHF
0.985R2@50UARM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UARMMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.985 | 0.013 | 0.016 | |
| MCNFMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.955 | 0.042 | 0.059 | |
| ClearMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.94 | 0.06 | 0.096 | |
| TorchNautMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.933 | 0.05 | 0.052 | |
| SCCPMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.925 | 0.064 | 0.09 | |
| Packed EnsembleMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.905 | 0.103 | 0.147 | |
| ACIMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.905 | 0.113 | 0.256 | |
| WCPMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.883 | 0.141 | 0.192 | |
| Deep EnsembleMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.881 | 0.11 | 0.167 | |
| DERMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.881 | 0.098 | 0.091 | |
| CQRMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.881 | 0.147 | 0.305 | |
| SCPMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.866 | 0.159 | 0.2 | |
| MC-DropoutMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.863 | 0.073 | 0.135 | |
| NaiveMiscoverage rate (alpha)=0.1, Confidence threshold=50% most confident samples2026.06 | 0.85 | 0.173 | 0.206 |