Worst-Case Estimation Error on HelpSteer2 (test)
18.7WCEROBIN
Evaluation Results
| Method | Links | |
|---|---|---|
| ROBINModel=gpt-4.1-nano, Attribute=correctness, Number of queries=100k2026.02 | 18.7 | |
| ROBINModel=gpt-4.1-nano, Attribute=helpfulness, Number of queries=100k2026.02 | 18.7 | |
| ROBINModel=llama-3-1-8b, Attribute=correctness, Number of queries=100k2026.02 | 19.5 | |
| ROBINModel=llama-3-1-8b, Attribute=complexity, Number of queries=100k2026.02 | 20.2 | |
| ROBINModel=llama-3-1-8b, Attribute=helpfulness, Number of queries=100k2026.02 | 20.3 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=correctness, Number of queries=100k2026.02 | 21.9 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=helpfulness, Number of queries=100k2026.02 | 22 | |
| ROBINModel=gpt-4.1-nano, Attribute=verbosity, Number of queries=100k2026.02 | 22.5 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=complexity, Number of queries=100k2026.02 | 23.3 | |
| ROBINModel=llama-3-1-8b, Attribute=verbosity, Number of queries=100k2026.02 | 24.3 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=correctness, Number of queries=100k2026.02 | 24.9 | |
| ROBINModel=gpt-4.1-nano, Attribute=complexity, Number of queries=100k2026.02 | 25.1 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=helpfulness, Number of queries=100k2026.02 | 25.5 | |
| ROBINModel=gpt-4.1-nano, Attribute=helpfulness, Number of queries=50k2026.02 | 26.3 | |
| UniformModel=llama-3-1-8b, Attribute=helpfulness, Number of queries=100k2026.02 | 26.5 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=helpfulness, Number of queries=50k2026.02 | 26.5 | |
| UniformModel=llama-3-1-8b, Attribute=complexity, Number of queries=100k2026.02 | 26.6 | |
| ROBINModel=gpt-4.1-nano, Attribute=correctness, Number of queries=50k2026.02 | 27.3 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=verbosity, Number of queries=100k2026.02 | 27.5 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=complexity, Number of queries=100k2026.02 | 28.7 | |
| ROBINModel=llama-3-1-8b, Attribute=correctness, Number of queries=50k2026.02 | 28.8 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=verbosity, Number of queries=100k2026.02 | 28.9 | |
| UniformModel=gpt-4.1-nano, Attribute=helpfulness, Number of queries=100k2026.02 | 29.1 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=correctness, Number of queries=50k2026.02 | 29.6 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=correctness, Number of queries=50k2026.02 | 30 | |
| UniformModel=llama-3-1-8b, Attribute=correctness, Number of queries=100k2026.02 | 31 | |
| ROBINModel=llama-3-1-8b, Attribute=complexity, Number of queries=50k2026.02 | 31.4 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=helpfulness, Number of queries=50k2026.02 | 31.4 | |
| UniformModel=gpt-4.1-nano, Attribute=complexity, Number of queries=100k2026.02 | 32 | |
| UniformModel=gpt-4.1-nano, Attribute=correctness, Number of queries=100k2026.02 | 32.1 | |
| ROBINModel=llama-3-1-8b, Attribute=helpfulness, Number of queries=50k2026.02 | 32.1 | |
| UniformModel=gpt-4.1-nano, Attribute=verbosity, Number of queries=100k2026.02 | 32.2 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=complexity, Number of queries=50k2026.02 | 32.4 | |
| ROBINModel=gpt-4.1-nano, Attribute=verbosity, Number of queries=50k2026.02 | 33.1 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=verbosity, Number of queries=50k2026.02 | 34.2 | |
| ROBINModel=llama-3-1-8b, Attribute=verbosity, Number of queries=50k2026.02 | 34.3 | |
| ROBIN-HOODModel=llama-3-1-8b, Attribute=verbosity, Number of queries=50k2026.02 | 36 | |
| ROBIN-HOODModel=gpt-4.1-nano, Attribute=complexity, Number of queries=50k2026.02 | 36.8 | |
| UniformModel=llama-3-1-8b, Attribute=verbosity, Number of queries=100k2026.02 | 36.9 | |
| ROBINModel=gpt-4.1-nano, Attribute=complexity, Number of queries=50k2026.02 | 38.1 | |
| UniformModel=llama-3-1-8b, Attribute=helpfulness, Number of queries=50k2026.02 | 38.3 | |
| UniformModel=llama-3-1-8b, Attribute=complexity, Number of queries=50k2026.02 | 38.5 | |
| UniformModel=gpt-4.1-nano, Attribute=helpfulness, Number of queries=50k2026.02 | 41.3 | |
| UniformModel=llama-3-1-8b, Attribute=correctness, Number of queries=50k2026.02 | 42 | |
| UniformModel=gpt-4.1-nano, Attribute=complexity, Number of queries=50k2026.02 | 43.7 | |
| UniformModel=gpt-4.1-nano, Attribute=correctness, Number of queries=50k2026.02 | 45.1 | |
| UniformModel=gpt-4.1-nano, Attribute=verbosity, Number of queries=50k2026.02 | 45.5 | |
| UniformModel=llama-3-1-8b, Attribute=verbosity, Number of queries=50k2026.02 | 52.3 |