Image editing preference evaluation on EditReward-Bench
63.27AccuracyGemini 3.1 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 3.1 ProARR=true2026.05 | 63.27 | |
| Gemini 3.1 Pro + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 63.27 | |
| Gemini 3.1 ProARR=false2026.05 | 61.23 | |
| Gemini 3.1 ProModel Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 61.23 | |
| GPT-5ARR=true2026.05 | 61.01 | |
| GPT-5 + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 61.01 | |
| GPT-5ARR=false2026.05 | 57.53 | |
| GPT-5Model Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 57.53 | |
| Qwen3-VL-8BARR=true2026.05 | 57.22 | |
| Qwen3vl-8B + ARRModel Category=ARR (Ours), Evaluation Protocol=ARR2026.05 | 57.22 | |
| EditReward2026.05 | 56.45 | |
| EditRewardModel Category=Trained Reward Model2026.05 | 56.45 | |
| Qwen3-VL-8BARR=false2026.05 | 54.01 | |
| Qwen3-VL-8BModel Category=VLM-as-Judge (Direct), Evaluation Protocol=Direct2026.05 | 54.01 |