Reward Modeling on WebGPT
58.4AccuracyUMM-RM
Evaluation Results
| Method | Links | |
|---|---|---|
| UMM-RMBase Model=Qwen2.5-0.5B, Activated Experts=62025.11 | 58.4 | |
| UMM-RMBase Model=Qwen2.5-0.5B, Activated Experts=22025.11 | 58.2 | |
| UMM-RMBase Model=Qwen2.5-0.5B, Activated Experts=42025.11 | 57.8 | |
| UMM-RMBase Model=Pythia-1.4B, Activated Experts=62025.11 | 57.8 | |
| Dense RMBase Model=Qwen2.5-0.5B2025.11 | 57.2 | |
| UMM-RMBase Model=Pythia-1.4B, Activated Experts=22025.11 | 54.2 | |
| UMM-RMBase Model=Pythia-1.4B, Activated Experts=42025.11 | 54 | |
| Dense RMBase Model=Pythia-1.4B2025.11 | 50.8 |