Element-level Text-to-Image Alignment Evaluation on MHaluBench
72.7SRCCREVEALER
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| REVEALERModel=Qwen3-VL-8B-Instruct2025.12 | 72.7 | 71.4 | 85.6 | |
| REVEALERModel=InternVL3-8B-hf2025.12 | 70.6 | 69.3 | 83.4 | |
| REVEALERModel=DINO, Gemini2.5-pro2025.12 | 69.9 | 68.5 | 82.4 | |
| TIFAModel=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 68.2 | 66.1 | 81.4 | |
| TIFAModel=Gemini2.5-pro, Paradigm=Zero-Shot2025.12 | 68 | 67.4 | 81.3 | |
| VIEScoreModel=GPT-4o, Paradigm=Zero-Shot2025.12 | 67.8 | 66.2 | 81.7 | |
| VQ2Model=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 66.7 | 65.3 | 81.1 | |
| REVEALERModel=Qwen3-VL-4B-Instruct2025.12 | 66.7 | 67.4 | 80.8 | |
| SFTModel=InternVL3-8B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 65.9 | 65.2 | 78.2 | |
| VQ2Model=GPT-4o, Paradigm=Zero-Shot2025.12 | 65.8 | 67.4 | 80.7 | |
| SFTModel=Qwen3-VL-8B-Instruct, Paradigm=Supervised Fine-Tuning2025.12 | 65.2 | 66.7 | 79.3 | |
| REVEALERModel=InternVL3-2B-hf2025.12 | 64.7 | 63.4 | 77.9 | |
| VQAScoreModel=CLIP-FlanT5-XXL, Paradigm=Zero-Shot2025.12 | 64.1 | 65.7 | 78.8 | |
| FGA-BLIP2Model=BLIP2, Paradigm=Supervised Fine-Tuning2025.12 | 63.2 | 65.1 | 77.7 | |
| SFTModel=LLaVA-v1.6-7B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 61.7 | 62.5 | 74.3 | |
| TIFAModel=mPLUG-Owl3, Paradigm=Zero-Shot2025.12 | 61.5 | 63 | 75 | |
| VQ2Model=LLaVA-v1.6-7B-hf, Paradigm=Zero-Shot2025.12 | 53.2 | 52.8 | 67.9 |