Human Preference Agreement on MM-RewardBench2 Edit
79.2AccuracyGemini 3.1 Pro + ARR
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 3.1 Pro + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 79.2 | |
| GPT-5 + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 77.5 | |
| Gemini 3.1 ProModel Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 77.4 | |
| GPT-5Model Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 73.8 | |
| EditRewardModel Category=Trained Reward Model2026.05 | 67.2 | |
| Qwen3vl-8B + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 65.5 | |
| Qwen3-VL-8BModel Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 59.2 |