Reward Modeling on PrincipleBench
93.8ClarityLlama-3.1-Nemotron-70B-Reward
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Llama-3.1-Nemotron-70B-RewardRM Type=Scalar, Inference Latency=<0.1 second/task2025.09 | 93.8 | 81.9 | 91.5 | 89.7 | 66.7 | 87.6 | 90.7 | 86 | 90 | 85.4 | 88.9 | 81.1 | 86.3 | 87.5 | |
| Flexible Principles ScalarRMRM Type=Scalar, Inference Latency=<0.1 second/task2025.09 | 90.6 | 89.4 | 94.9 | 100 | 87.5 | 92.1 | 90 | 92.1 | 89 | 89.6 | 94.8 | 93.7 | 91.8 | 91.6 | |
| Llama-3.3-Nemotron-70B-RewardRM Type=Scalar, Inference Latency=<0.1 second/task2025.09 | 87.5 | 90.4 | 93.2 | 89.7 | 66.7 | 89.9 | 92 | 87.1 | 92.8 | 87.5 | 89.6 | 84.2 | 88.5 | 89.7 | |
| Bradley-TerryRM Type=Scalar, Inference Latency=<0.1 second/task2025.09 | 84.4 | 91.5 | 89.8 | 89.7 | 83.3 | 88.8 | 90.7 | 88.3 | 90.4 | 87.5 | 88.2 | 90.5 | 89.2 | 89.5 | |
| Flexible Principles GenRMRM Type=Generative, Inference Latency=>10 seconds/task2025.09 | 84.4 | 84 | 79.7 | 82.1 | 100 | 82 | 84 | 85.2 | 81.3 | 70.8 | 87.4 | 90.5 | 82.5 | 83.8 | |
| Llama-3.3-Nemotron-Super-49B-GenRMRM Type=Generative, Inference Latency=>10 seconds/task2025.09 | 81.2 | 80.9 | 81.4 | 89.7 | 62.5 | 85.4 | 82.7 | 80.5 | 83.3 | 66.7 | 88.1 | 78.9 | 79.3 | 82.1 | |
| RewardAnything-8B-v1RM Type=Generative, Inference Latency=>10 seconds/task2025.09 | 78.1 | 61.7 | 62.7 | 82.1 | 87.5 | 80.9 | 75.3 | 75.5 | 68.9 | 66.7 | 76.3 | 83.2 | 73.8 | 73.5 | |
| RM-R1-DeepSeek-Distilled-Qwen-32BRM Type=Generative, Inference Latency=>10 seconds/task2025.09 | 78.1 | 73.4 | 64.4 | 82.1 | 50 | 76.4 | 77.3 | 71.7 | 69.9 | 75 | 80.7 | 72.6 | 74.6 | 73.9 | |
| R3-QWEN3-14B-LORA-4KRM Type=Generative, Inference Latency=>10 seconds/task2025.09 | 56.3 | 66 | 62.7 | 79.5 | 41.7 | 79.8 | 65.3 | 64.5 | 64.1 | 56.3 | 74.8 | 68.4 | 65.9 | 67.2 |