3D Text-Fidelity Preference Evaluation on OOD Preference Evaluation Dataset Text-Fidelity
86AccuracyGen3DEval (CLIP)
Evaluation Results
| Method | Links | |
|---|---|---|
| Gen3DEval (CLIP)backbone=CLIP2025.04 | 86 | |
| Image Reward ScorePrompt/Input handling=None (empty strings passed)2025.04 | 85 | |
| PickScorePrompt/Input handling=None (empty strings passed)2025.04 | 85 | |
| CLIP ScorePrompt/Input handling=None (empty strings passed)2025.04 | 80 | |
| Gen3DEval (CLIP + DinoV2)backbone=CLIP + DinoV22025.04 | 74 | |
| Phi-3.5-Vision2025.04 | 65 | |
| LLaVA-Qwen-7B2025.04 | 58 | |
| Gen3DEval w/ DinoV2backbone=DinoV22025.04 | 58 | |
| GPT-4omulti-image support=false2025.04 | 55 | |
| Gen3DEval (CLIP + Fit3D)backbone=CLIP + Fit3D2025.04 | 53 | |
| LLaVA-Llama3-8b2025.04 | 50 | |
| Llama3.2-Vision-11Bmulti-image support=false2025.04 | 50 | |
| Gen3DEval w/ Fit3Dbackbone=Fit3D2025.04 | 44 | |
| BLIPmulti-image support=false2025.04 | 13 | |
| PaliGemmamulti-image support=false2025.04 | 10 |