Human Preference Agreement on MM-RewardBench2 T2I
78.9AccuracyGemini 3.1 Pro + ARR
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 3.1 Pro + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 78.9 | |
| Gemini 3.1 ProModel Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 75.1 | |
| GPT-5 + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 74.7 | |
| GPT-5Model Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 70.5 | |
| UnifiedReward-ThinkingModel Category=Trained Reward Model2026.05 | 66 | |
| Qwen3vl-8B + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 62.7 | |
| HPSv3Model Category=Trained Reward Model2026.05 | 60.2 | |
| UnifiedRewardModel Category=Trained Reward Model2026.05 | 59.8 | |
| PickScoreModel Category=Trained Reward Model2026.05 | 58.6 | |
| Qwen3-VL-8BModel Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 57.6 | |
| HPSv2Model Category=Trained Reward Model2026.05 | 54.7 | |
| ImageRewardModel Category=Trained Reward Model2026.05 | 54 | |
| CLIPScoreModel Category=Trained Reward Model2026.05 | 51 |