Visual Question Answering on OVEN Query 1.0 (test)
30.9HMGiT-Large
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GiT-Large#par (B)=0.4, Training Dataset=REW-47M (Ours), Evaluation Protocol=+ seen finetune2024.10 | 30.9 | 39.2 | 25.5 | |
| GiT-Large#par (B)=0.4, Training Dataset=REW-47M (Ours), Evaluation Protocol=Zero-shot2024.10 | 30 | 31.2 | 28.9 | |
| PaLI-17B#par (B)=17, Training Dataset=WebLI-1B [9], Evaluation Protocol=+ seen finetune2024.10 | 27.1 | 36.2 | 21.7 | |
| PaLI-3B#par (B)=3, Training Dataset=WebLI-1B [9], Evaluation Protocol=+ seen finetune2024.10 | 16.7 | 27.4 | 12 | |
| GiT-Large#par (B)=0.4, Training Dataset=WebLI-100M [9], Evaluation Protocol=+ seen finetune2024.10 | 15.6 | 28.9 | 10.7 | |
| GiT-Large#par (B)=0.4, Training Dataset=Entity-WebLI [7], Evaluation Protocol=Zero-shot2024.10 | 10.4 | 9.8 | 11 | |
| GiT-Large#par (B)=0.4, Training Dataset=Entity-WebLI [7], Evaluation Protocol=+ seen finetune2024.10 | 10.1 | 17.7 | 7.1 | |
| PaLI-17B#par (B)=17, Training Dataset=WebLI-1B [9], Evaluation Protocol=Zero-shot2024.10 | 9.2 | 14.1 | 6.8 | |
| GER-ALD#par (B)=0.4, Training Dataset=Entity-WebLI [7], Evaluation Protocol=Zero-shot2024.10 | 6.3 | 6 | 6.7 | |
| GER-ALD#par (B)=0.4, Training Dataset=Entity-WebLI [7], Evaluation Protocol=+ seen finetune2024.10 | 5.8 | 14.1 | 3.6 | |
| GiT-Large#par (B)=0.4, Training Dataset=WebLI-100M [9], Evaluation Protocol=Zero-shot2024.10 | 3.9 | 5.1 | 3.2 | |
| CLIP2CLIP#par (B)=0.9, Training Dataset=OpenAI [41], Evaluation Protocol=+ seen finetune2024.10 | 3.5 | 3.8 | 3.2 | |
| CLIPfusion#par (B)=0.9, Training Dataset=OpenAI [41], Evaluation Protocol=+ seen finetune2024.10 | 2.7 | 25.8 | 1.4 | |
| CLIPfusion#par (B)=0.9, Training Dataset=OpenAI [41], Evaluation Protocol=Zero-shot2024.10 | 1.6 | 1.3 | 2 | |
| CLIP2CLIP#par (B)=0.9, Training Dataset=OpenAI [41], Evaluation Protocol=Zero-shot2024.10 | 1.6 | 1.3 | 2 |