General Language Model Evaluation on Arena-Hard V2.0
7.03Win RateRM-NLHF
Evaluation Results
| Method | Links | |
|---|---|---|
| RM-NLHFEvaluation Protocol=Feedback-Edit, Scoring Strategy=RM-NLHF2026.01 | 7.03 | |
| Outcome-onlyEvaluation Protocol=Feedback-Edit, Scoring Strategy=Outcome-only2026.01 | 6.55 | |
| RM-NLHFEvaluation Protocol=BoN, Sample Size (N)=8, Scoring Strategy=RM-NLHF2026.01 | 4.64 | |
| Outcome-onlyEvaluation Protocol=BoN, Sample Size (N)=8, Scoring Strategy=Outcome-only2026.01 | 4.3 | |
| Outcome-onlyEvaluation Protocol=BoN, Sample Size (N)=4, Scoring Strategy=Outcome-only2026.01 | 3.93 | |
| RM-NLHFEvaluation Protocol=BoN, Sample Size (N)=4, Scoring Strategy=RM-NLHF2026.01 | 3.85 | |
| Outcome-onlyEvaluation Protocol=BoN, Sample Size (N)=2, Scoring Strategy=Outcome-only2026.01 | 3.69 | |
| RM-NLHFEvaluation Protocol=BoN, Sample Size (N)=2, Scoring Strategy=RM-NLHF2026.01 | 3.56 | |
| DeepSeek-Distilled-Qwen-7BEvaluation Protocol=Base Model2026.01 | 3.39 |