Element-level text-to-image alignment evaluation on RichHF
73.3SRCCREVEALER
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| REVEALERModel=Qwen3-VL-8B-Instruct2025.12 | 73.3 | 72.5 | 86.1 | |
| REVEALERModel=InternVL3-8B-hf2025.12 | 70.8 | 69.2 | 84.7 | |
| REVEALERModel=Qwen3-VL-4B-Instruct2025.12 | 68.9 | 67.2 | 81.4 | |
| REVEALERModel=DINO, Gemini2.5-pro2025.12 | 67.9 | 67.8 | 82.6 | |
| TIFAModel=Gemini2.5-pro, Paradigm=Zero-Shot2025.12 | 65.9 | 66.4 | 80.1 | |
| VIEScoreModel=GPT-4o, Paradigm=Zero-Shot2025.12 | 65.8 | 66.2 | 79.1 | |
| TIFAModel=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 64.7 | 65.3 | 79.2 | |
| VQ2Model=GPT-4o, Paradigm=Zero-Shot2025.12 | 63.9 | 64.8 | 77.9 | |
| VQAScoreModel=CLIP-FlanT5-XXL, Paradigm=Zero-Shot2025.12 | 63.9 | 65.7 | 77.2 | |
| REVEALERModel=InternVL3-2B-hf2025.12 | 63.5 | 64.2 | 78.6 | |
| SFTModel=Qwen3-VL-8B-Instruct, Paradigm=Supervised Fine-Tuning2025.12 | 63.4 | 63.9 | 76.7 | |
| VQ2Model=Qwen2.5-VL-72B, Paradigm=Zero-Shot2025.12 | 62.9 | 63.5 | 77.6 | |
| TIFAModel=mPLUG-Owl3, Paradigm=Zero-Shot2025.12 | 62.7 | 62.3 | 77.1 | |
| SFTModel=InternVL3-8B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 60.2 | 61.4 | 75.8 | |
| FGA-BLIP2Model=BLIP2, Paradigm=Supervised Fine-Tuning2025.12 | 56.6 | 57.9 | 71.4 | |
| SFTModel=LLaVA-v1.6-7B-hf, Paradigm=Supervised Fine-Tuning2025.12 | 55.7 | 57.4 | 70.9 | |
| VQ2Model=LLaVA-v1.6-7B-hf, Paradigm=Zero-Shot2025.12 | 40.2 | 41.7 | 54.3 |