Text-to-Image Generation Evaluation on GenAI-Bench (Pearson-r)
70.3Pearson-rGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProScale=/2025.06 | 70.3 | |
| UnifiedReward_QScale=8B2025.06 | 62.7 | |
| UnifiedReward_LScale=7B2025.06 | 62.6 | |
| Qwen3-VLScale=8B2025.06 | 61.6 | |
| GPT-4oScale=/2025.06 | 60.9 | |
| MinosScale=8B2025.06 | 60.2 | |
| LLaVA-CriticScale=72B2025.06 | 53.2 | |
| LLaVA-OVScale=72B2025.06 | 51.6 | |
| LLaVA-CriticScale=7B2025.06 | 33 | |
| Prometheus-VScale=7B2025.06 | 18.6 | |
| LLaVA-OVScale=7B2025.06 | 16.4 |