Element-level Text-to-Image Alignment Evaluation on EvalMuse-40K
72.3SRCCREVEALER
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| REVEALERModel=Qwen3-VL-8B-Instruct2025.12 | 72.3 | 71.8 | 85.3 | |
| REVEALERModel=InternVL3-8B-hf2025.12 | 70.4 | 69.5 | 83.9 | |
| REVEALERModel=DINO, Gemini2.5-pro2025.12 | 69.2 | 68.4 | 83.2 | |
| VQ2Model=GPT-4o, Paradigm=Zero-Shot2025.12 | 67.9 | 66.4 | 81.7 | |
| VQ2Model=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 67.6 | 66.8 | 81.5 | |
| TIFAModel=Gemini2.5-pro, Paradigm=Zero-Shot2025.12 | 67.3 | 66 | 81.2 | |
| REVEALERModel=Qwen3-VL-4B-Instruct2025.12 | 66.1 | 65.8 | 80.3 | |
| TIFAModel=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 65.8 | 66.3 | 80.7 | |
| VIEScoreModel=GPT-4o, Paradigm=Zero-Shot2025.12 | 65.3 | 66.5 | 80.2 | |
| REVEALERModel=InternVL3-2B-hf2025.12 | 64.7 | 65.3 | 77.8 | |
| FGA-BLIP2Model=BLIP2, Paradigm=Supervised Fine-Tuning2025.12 | 62.1 | 64.6 | 76.8 | |
| SFTModel=Qwen3-VL-8B-Instruct, Paradigm=Supervised Fine-Tuning2025.12 | 58.6 | 57.1 | 72.2 | |
| SFTModel=InternVL3-8B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 57.4 | 56.8 | 72.5 | |
| SFTModel=LLaVA-v1.6-7B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 54.7 | 55.2 | 73.1 | |
| VQ2Model=LLaVA-v1.6-7B-hf, Paradigm=Zero-Shot2025.12 | 52.7 | 53.8 | 67.5 | |
| VQAScoreModel=CLIP-FlanT5-XXL, Paradigm=Zero-Shot2025.12 | 51.8 | 51.2 | 65.5 | |
| TIFAModel=mPLUG-Owl3, Paradigm=Zero-Shot2025.12 | 50 | 52.8 | 64.5 |