element-level text-to-image alignment evaluation on GenAI-Bench
0.749SRCCREVEALER
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| REVEALERModel=Qwen3-VL-8B-Instruct2025.12 | 0.749 | 0.756 | 86.8 | |
| REVEALERModel=InternVL3-8B-hf2025.12 | 0.734 | 0.719 | 85 | |
| REVEALERModel=DINO, Gemini2.5-pro2025.12 | 0.723 | 0.738 | 84.7 | |
| TIFAModel=Gemini2.5-pro, Paradigm=Zero-Shot2025.12 | 0.711 | 0.722 | 84.2 | |
| VQAScoreModel=CLIP-FlanT5-XXL, Paradigm=Zero-Shot2025.12 | 0.708 | 0.693 | 84.1 | |
| VQ2Model=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 0.704 | 0.722 | 83.5 | |
| VQ2Model=GPT-4o, Paradigm=Zero-Shot2025.12 | 0.702 | 0.714 | 84.1 | |
| REVEALERModel=Qwen3-VL-4B-Instruct2025.12 | 0.696 | 0.689 | 82.6 | |
| TIFAModel=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 0.692 | 0.707 | 82.8 | |
| VIEScoreModel=GPT-4o, Paradigm=Zero-Shot2025.12 | 0.692 | 0.686 | 82.9 | |
| SFTModel=InternVL3-8B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 0.678 | 0.681 | 78.1 | |
| SFTModel=Qwen3-VL-8B-Instruct, Paradigm=Supervised Fine-Tuning2025.12 | 0.671 | 0.657 | 80.3 | |
| REVEALERModel=InternVL3-2B-hf2025.12 | 0.668 | 0.663 | 79.4 | |
| FGA-BLIP2Model=BLIP2, Paradigm=Supervised Fine-Tuning2025.12 | 0.653 | 0.669 | 79 | |
| SFTModel=LLaVA-v1.6-7B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 0.629 | 0.635 | 76.5 | |
| TIFAModel=mPLUG-Owl3, Paradigm=Zero-Shot2025.12 | 0.607 | 0.614 | 74.1 | |
| VQ2Model=LLaVA-v1.6-7B-hf, Paradigm=Zero-Shot2025.12 | 0.349 | 0.355 | 47.3 |