Multimodal Judgment on Diff
0.361ScoreGPT-4V
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4VLoRA Training=true2026.06 | 0.361 | 66.8 | 88.4 | 7 | |
| Perception-Judge-Qwen3Size=4B2026.06 | 0.347 | 77.7 | 81.5 | 29.6 | |
| GPT-4oLoRA Training=true2026.06 | 0.341 | 66.8 | 93.4 | — | |
| Perception-Judge-Qwen3Size=8B2026.06 | 0.314 | 74.4 | 78.1 | 29.3 | |
| Qwen3-VL-ThinkingSize=8B2026.06 | 0.277 | 69.9 | 73.3 | 33.9 | |
| Qwen3-VL-ThinkingSize=4B2026.06 | 0.271 | 74.3 | 77.6 | 40.1 | |
| Flex-Judge-VLSize=32B, LoRA Training=true2026.06 | 0.215 | 86.8 | 90.6 | 36.1 | |
| Perception-Judge-FlexSize=32B, LoRA Training=true2026.06 | 0.195 | 85.2 | 89.4 | 34.1 | |
| Perception-Judge-FlexSize=7B2026.06 | 0.14 | 56.7 | 59.2 | 48.7 | |
| Prometheus-VSize=13B, LoRA Training=true2026.06 | 0.106 | — | — | — | |
| LLaVA-CriticSize=7B, LoRA Training=true2026.06 | 0.103 | 70.7 | 75.5 | — | |
| LLaVA-1.5Size=13B2026.06 | 0.06 | 28.6 | 30.2 | 56.2 | |
| Flex-Judge-VLSize=7B2026.06 | 0.049 | 61.1 | 63.4 | 53.1 | |
| LLaVA-1.6Size=34B2026.06 | -0.012 | — | — | — | |
| Qwen2.5-VL-InstructSize=7B2026.06 | -0.02 | 50.7 | 51 | 59.3 |