Pairwise Preference Comparison on 150 prompt-response pairs
63.3333Win RateRL-trained policy
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RL-trained policyJudge=Model Majority2026.05 | 63.3333 | 23.3333 | 13.3333 | |
| RL-trained policyJudge=Qwen3.5-397B-A17B2026.05 | 62 | 23.3333 | 14.6667 | |
| RL-trained policyJudge=GPT-5.52026.05 | 60 | 25.3333 | 14.6667 | |
| RL-trained policyJudge=Claude Opus 4.72026.05 | 58.6667 | 26.6667 | 14.6667 | |
| RL-trained policyJudge=GLM-4.72026.05 | 56.6667 | 26.6667 | 16.6667 | |
| RL-trained policyJudge=Human-22026.05 | 54.6667 | 34 | 11.3333 | |
| RL-trained policyJudge=Human-12026.05 | 51.3333 | 38.6667 | 10 | |
| RL-trained policyJudge=Human Majority2026.05 | 50.6667 | 40.6667 | 8.6667 | |
| RL-trained policyJudge=Human-32026.05 | 45.3333 | 46.6667 | 8 |