Visual Question Answering on VQAv2 (first quarter)
80ScoreClean
Evaluation Results
| Method | Links | |
|---|---|---|
| CleanModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 80 | |
| CleanModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | 78.8 | |
| CleanModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 75.6 | |
| Both-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 74.7 | |
| Img-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 72.1 | |
| Both-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 70.4 | |
| Img-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 69.9 | |
| Text-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 69.6 | |
| Text-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 57.7 | |
| CleanModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 56.6 | |
| Both-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 52.8 | |
| Img-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 50.7 | |
| VEV-UAPModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 46.8 | |
| Img-EmbModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | 45.7 | |
| Text-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 43.8 | |
| VEV-UAPModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | 42.8 | |
| VEV-UAPModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 2.1 | |
| VEV-UAPModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 0.3 |