Preference Prediction on JudgeBench
74.8Positional Consistent AccuracyMRRG
Evaluation Results
| Method | Links | |
|---|---|---|
| MRRGBackbone=GPT-OSS-120B2026.07 | 74.8 | |
| MRRGBackbone=GPT-OSS-20B2026.07 | 74 | |
| SVRG w/ SRBackbone=GPT-OSS-120B2026.07 | 67.8 | |
| SVRG w/ SRBackbone=GPT-OSS-20B2026.07 | 67.7 | |
| MRRGBackbone=Qwen2.5-32B-Instruct2026.07 | 65.1 | |
| Chasing the TailBackbone=GPT-OSS-120B2026.07 | 64 | |
| Reasoning RM + External-Rubric (32B)Backbone=Qwen3-8B2026.04 | 63.9 | |
| C2Backbone=Qwen3-8B2026.04 | 63.5 | |
| Chasing the TailBackbone=GPT-OSS-20B2026.07 | 63.1 | |
| Base ModelBackbone=Qwen3-8B2026.04 | 60.9 | |
| Reasoning RM + Self-RubricBackbone=Qwen3-8B2026.04 | 60.8 | |
| Reasoning RMBackbone=Qwen3-8B2026.04 | 60.1 | |
| Reasoning RM + External-Rubric (32B)Backbone=Tulu3-8B-SFT2026.04 | 59.2 | |
| MRRGBackbone=Qwen2.5-7B-Instruct2026.07 | 56.9 | |
| SVRG w/o SRBackbone=GPT-OSS-120B2026.07 | 56.5 | |
| MRRGBackbone=Qwen2.5-3B-Instruct2026.07 | 55.1 | |
| SVRG w/o SRBackbone=GPT-OSS-20B2026.07 | 54.3 | |
| Chasing the TailBackbone=Qwen2.5-32B-Instruct2026.07 | 52 | |
| SVRG w/ SRBackbone=Qwen2.5-32B-Instruct2026.07 | 47.4 | |
| SVRG w/ SRBackbone=Qwen2.5-3B-Instruct2026.07 | 40.9 | |
| Chasing the TailBackbone=Qwen2.5-7B-Instruct2026.07 | 40.5 | |
| C2Backbone=Tulu3-8B-SFT2026.04 | 39.8 | |
| SVRG w/o SRBackbone=Qwen2.5-32B-Instruct2026.07 | 37.1 | |
| Reasoning RMBackbone=Tulu3-8B-SFT2026.04 | 35.8 | |
| Reasoning RM + Self-RubricBackbone=Tulu3-8B-SFT2026.04 | 35.2 | |
| SVRG w/o SRBackbone=Qwen2.5-3B-Instruct2026.07 | 35.1 | |
| SVRG w/ SRBackbone=Qwen2.5-7B-Instruct2026.07 | 35.1 | |
| SVRG w/o SRBackbone=Qwen2.5-7B-Instruct2026.07 | 32.3 | |
| Chasing the TailBackbone=Qwen2.5-3B-Instruct2026.07 | 31.1 | |
| Base ModelBackbone=Tulu3-8B-SFT2026.04 | 22.7 |