Image-editing evaluation summary on EditReward-Bench and GenAI-Bench Combined
47.4Average ScoreREWARDHARNESS (Gemini-2.0-Flash)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| REWARDHARNESS (Gemini-2.0-Flash)Sub-Agent=Gemini-2.0-Flash2026.05 | 47.4 | 13.9 | |
| REWARDHARNESS (Qwen)Sub-Agent=Qwen2026.05 | 45.7 | 12.2 | |
| EditReward (MiMo)Model Type=Open-Source Models, Backbone=MiMo2026.05 | 44.1 | 10.6 | |
| GPT-5Model Type=Proprietary Models2026.05 | 42.1 | 8.6 | |
| EditReward (Qwen)Model Type=Open-Source Models, Backbone=Qwen2026.05 | 42 | 8.5 | |
| Gemini-2.5-FlashModel Type=Proprietary Models2026.05 | 41.9 | 8.4 | |
| Gemini-2.0-FlashModel Type=Proprietary Models2026.05 | 38.1 | 4.6 | |
| MiMo-VL-7BModel Type=Open-Source Models2026.05 | 36.8 | 3.3 | |
| Claude-Haiku-4.5Model Type=Proprietary Models2026.05 | 35.8 | 2.3 | |
| GPT-4oModel Type=Proprietary Models2026.05 | 33.5 | — | |
| Qwen2.5-VL-7BModel Type=Open-Source Models2026.05 | 30.3 | 3.2 | |
| Qwen2.5-VL-32BModel Type=Open-Source Models2026.05 | 29.8 | 3.7 |