Multimodal Evaluation Consistency on MLLM-as-a-Judge, RichHF-18K, GenAI-Bench
44.2Average ScoreGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oScale=/2025.06 | 44.2 | |
| MinosScale=8B2025.06 | 42.3 | |
| Minos(8B)Model=Minos(8B)2025.06 | 42.3 | |
| Gemini-2.5-ProScale=/2025.06 | 41.5 | |
| Gemini-2.5-ProModel=Gemini-2.5-Pro2025.06 | 41.5 | |
| LLaVA-CriticScale=72B2025.06 | 39.8 | |
| Qwen3-VLScale=8B2025.06 | 38.4 | |
| Qwen3-VL(8B)Model=Qwen3-VL(8B)2025.06 | 38.4 | |
| UnifiedReward_QScale=8B2025.06 | 37.2 | |
| UnifiedReward_Q(8B)Model=UnifiedReward_Q(8B)2025.06 | 37.2 | |
| GPT-4oModel=GPT-4o2025.06 | 35.9 | |
| LLaVA-Critic(72B)Model=LLaVA-Critic(72B)2025.06 | 35.4 | |
| UnifiedReward_LScale=7B2025.06 | 33.6 | |
| UnifiedReward_L(7B)Model=UnifiedReward_L(7B)2025.06 | 33.6 | |
| LLaVA-CriticScale=7B2025.06 | 30.7 | |
| LLaVA-OVScale=72B2025.06 | 30 | |
| LLaVA-Critic(7B)Model=LLaVA-Critic(7B)2025.06 | 27.8 | |
| LLaVA-OV(72B)Model=LLaVA-OV(72B)2025.06 | 26.8 | |
| LLaVA-OV(7B)Model=LLaVA-OV(7B)2025.06 | 21.9 | |
| Prometheus-VScale=7B2025.06 | 20.3 | |
| Prometheus-V(7B)Model=Prometheus-V(7B)2025.06 | 16.2 | |
| LLaVA-OVScale=7B2025.06 | 14.6 |