3D Text-Fidelity Preference Evaluation on Synthetic Preference Evaluation Dataset Text-Fidelity
100AccuracyGen3DEval (CLIP + Fit3D)
Evaluation Results
| Method | Links | |
|---|---|---|
| Gen3DEval (CLIP + Fit3D)backbone=CLIP + Fit3D2025.04 | 100 | |
| Gen3DEval (CLIP)backbone=CLIP2025.04 | 98 | |
| Gen3DEval (CLIP + DinoV2)backbone=CLIP + DinoV22025.04 | 98 | |
| Gen3DEval w/ Fit3Dbackbone=Fit3D2025.04 | 93 | |
| PickScorePrompt/Input handling=None (empty strings passed)2025.04 | 81 | |
| CLIP ScorePrompt/Input handling=None (empty strings passed)2025.04 | 78 | |
| Gen3DEval w/ DinoV2backbone=DinoV22025.04 | 75 | |
| LLaVA-Qwen-7B2025.04 | 68 | |
| Image Reward ScorePrompt/Input handling=None (empty strings passed)2025.04 | 65 | |
| Phi-3.5-Vision2025.04 | 64 | |
| GPT-4omulti-image support=false2025.04 | 61 | |
| LLaVA-Llama3-8b2025.04 | 49 | |
| BLIPmulti-image support=false2025.04 | 37 | |
| PaliGemmamulti-image support=false2025.04 | 17 | |
| Llama3.2-Vision-11Bmulti-image support=false2025.04 | 4 |