Multimodal Judgment on COCO
41ScoreGPT-4V
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4VLoRA Training=true2026.06 | 41 | 53.9 | 72.9 | 31.8 | |
| GPT-4oLoRA Training=true2026.06 | 39.6 | 53.9 | 77.4 | — | |
| LLaVA-CriticSize=7B, LoRA Training=true2026.06 | 38.2 | 59.3 | 77.1 | — | |
| Perception-Judge-Qwen3Size=8B2026.06 | 37.7 | 56.7 | 74.1 | 42.1 | |
| Perception-Judge-FlexSize=32B, LoRA Training=true2026.06 | 37.6 | 58.9 | 76.9 | 43.8 | |
| Perception-Judge-Qwen3Size=4B2026.06 | 34.8 | 54.1 | 70.7 | 44.7 | |
| Qwen3-VL-ThinkingSize=4B2026.06 | 34.2 | 54.7 | 70.8 | 53.2 | |
| Qwen3-VL-ThinkingSize=8B2026.06 | 32.4 | 56 | 72.5 | 46.1 | |
| Qwen2.5-VL-InstructSize=7B2026.06 | 29.4 | 44.6 | 47.9 | 56.2 | |
| Perception-Judge-FlexSize=7B2026.06 | 29.3 | 54.1 | 70.3 | 46.7 | |
| Prometheus-VSize=13B, LoRA Training=true2026.06 | 28.9 | — | — | — | |
| LLaVA-1.6Size=34B2026.06 | 28.5 | — | — | — | |
| Gemini-1.0-Pro-Vision2026.06 | 26.2 | 61.6 | 71.7 | 28.7 | |
| LLaVA-1.5Size=13B2026.06 | 24.7 | 27.3 | 32.7 | 57.7 | |
| Flex-Judge-VLSize=32B, LoRA Training=true2026.06 | 23.4 | 58.6 | 76.1 | 45 | |
| Flex-Judge-VLSize=7B2026.06 | 20.1 | 50.4 | 64.4 | 48.7 |