Visual Reasoning on VizWiz
0.11ECEPlausibility
Evaluation Results
| Method | Links | |
|---|---|---|
| PlausibilityModel=LLaVA2025.09 | 0.11 | |
| Avg(VF, Contr.)Model=Qwen2.52025.09 | 0.138 | |
| Visual FidelityModel=Qwen2.52025.09 | 0.139 | |
| Avg(VF, Contr.)Model=LLaVA2025.09 | 0.139 | |
| Visual FidelityModel=GPT-4o2025.09 | 0.16 | |
| Avg(VF, Contr.)Model=Avg2025.09 | 0.164 | |
| InformativenessModel=Qwen2.52025.09 | 0.168 | |
| Visual FidelityModel=Avg2025.09 | 0.19 | |
| Avg(VF, Contr.)Model=GPT-4o2025.09 | 0.216 | |
| PlausibilityModel=Avg2025.09 | 0.248 | |
| Min(VF, Contr.)Model=LLaVA2025.09 | 0.265 | |
| Visual FidelityModel=LLaVA2025.09 | 0.271 | |
| Min(VF, Contr.)Model=Qwen2.52025.09 | 0.284 | |
| Prod(VF, Contr.)Model=LLaVA2025.09 | 0.29 | |
| SimulatabilityModel=Qwen2.52025.09 | 0.292 | |
| ContrastivenessModel=Qwen2.52025.09 | 0.292 | |
| ContrastivenessModel=LLaVA2025.09 | 0.294 | |
| Prod(VF, Contr.)Model=Qwen2.52025.09 | 0.296 | |
| SimulatabilityModel=LLaVA2025.09 | 0.305 | |
| PlausibilityModel=Qwen2.52025.09 | 0.31 | |
| PlausibilityModel=GPT-4o2025.09 | 0.325 | |
| Min(VF, Contr.)Model=Avg2025.09 | 0.325 | |
| ContrastivenessModel=Avg2025.09 | 0.337 | |
| Prod(VF, Contr.)Model=Avg2025.09 | 0.337 | |
| InformativenessModel=Avg2025.09 | 0.348 | |
| SimulatabilityModel=Avg2025.09 | 0.364 | |
| ContrastivenessModel=GPT-4o2025.09 | 0.424 | |
| Min(VF, Contr.)Model=GPT-4o2025.09 | 0.425 | |
| Prod(VF, Contr.)Model=GPT-4o2025.09 | 0.426 | |
| InformativenessModel=LLaVA2025.09 | 0.429 | |
| InformativenessModel=GPT-4o2025.09 | 0.446 | |
| SimulatabilityModel=GPT-4o2025.09 | 0.494 |