Generative AI Evaluation Consistency on GenAI-Bench
70.3Pearson Correlation Score (r)Gemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProModel=Gemini-2.5-Pro2025.06 | 70.3 | |
| UnifiedReward_Q(8B)Model=UnifiedReward_Q(8B)2025.06 | 62.7 | |
| UnifiedReward_L(7B)Model=UnifiedReward_L(7B)2025.06 | 62.6 | |
| Qwen3-VL(8B)Model=Qwen3-VL(8B)2025.06 | 61.6 | |
| GPT-4oModel=GPT-4o2025.06 | 60.9 | |
| Minos(8B)Model=Minos(8B)2025.06 | 60.2 | |
| LLaVA-Critic(72B)Model=LLaVA-Critic(72B)2025.06 | 53.2 | |
| LLaVA-OV(72B)Model=LLaVA-OV(72B)2025.06 | 51.6 | |
| LLaVA-Critic(7B)Model=LLaVA-Critic(7B)2025.06 | 33 | |
| Prometheus-V(7B)Model=Prometheus-V(7B)2025.06 | 18.6 | |
| LLaVA-OV(7B)Model=LLaVA-OV(7B)2025.06 | 16.4 |