Preference Validation on RewardBench 2
74.5AccuracyMRRG
Evaluation Results
| Method | Links | |
|---|---|---|
| MRRGBackbone=GPT-OSS-120B2026.07 | 74.5 | |
| MRRGBackbone=GPT-OSS-20B2026.07 | 73.7 | |
| MRRGBackbone=Qwen2.5-32B-Instruct2026.07 | 65.3 | |
| SVRG w/ SRBackbone=GPT-OSS-120B2026.07 | 64.4 | |
| SVRG w/ SRBackbone=GPT-OSS-20B2026.07 | 62.4 | |
| Chasing the TailBackbone=GPT-OSS-120B2026.07 | 61.3 | |
| Chasing the TailBackbone=GPT-OSS-20B2026.07 | 60.3 | |
| Chasing the TailBackbone=Qwen2.5-32B-Instruct2026.07 | 59.4 | |
| MRRGBackbone=Qwen2.5-7B-Instruct2026.07 | 59.2 | |
| SVRG w/ SRBackbone=Qwen2.5-32B-Instruct2026.07 | 54.9 | |
| SVRG w/o SRBackbone=GPT-OSS-120B2026.07 | 52.3 | |
| MRRGBackbone=Qwen2.5-3B-Instruct2026.07 | 51.2 | |
| SVRG w/o SRBackbone=GPT-OSS-20B2026.07 | 51.2 | |
| SVRG w/ SRBackbone=Qwen2.5-7B-Instruct2026.07 | 50.7 | |
| SVRG w/o SRBackbone=Qwen2.5-32B-Instruct2026.07 | 42.3 | |
| SVRG w/ SRBackbone=Qwen2.5-3B-Instruct2026.07 | 40.3 | |
| SVRG w/o SRBackbone=Qwen2.5-7B-Instruct2026.07 | 37.6 | |
| Chasing the TailBackbone=Qwen2.5-7B-Instruct2026.07 | 36.5 | |
| SVRG w/o SRBackbone=Qwen2.5-3B-Instruct2026.07 | 29.4 | |
| Chasing the TailBackbone=Qwen2.5-3B-Instruct2026.07 | 21.3 |