Visual Question Answering on COCO-QA
41.56AccuracyTA-VQ
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| TA-VQSetting=TA-VQ2025.03 | 41.56 | — | — | — | — | — | — | — | 83.77 | |
| LG-VQSetting=LG-VQ, Codebook=MS-COCO’s codebook2024.05 | 40.97 | — | — | — | — | — | — | — | 83.56 | |
| LG-VQSetting=LG-VQ [29]2025.03 | 40.97 | — | — | — | — | — | — | — | 83.56 | |
| VQCTSetting=VQCT [51], Codebook=MS-COCO’s codebook2024.05 | 40.42 | — | — | — | — | — | — | — | 82.06 | |
| VQCTSetting=VQCT [60]2025.03 | 40.42 | — | — | — | — | — | — | — | 82.06 | |
| VQ-GANSetting=VQ-GAN, Codebook=MS-COCO’s codebook2024.05 | 37.82 | — | — | — | — | — | — | — | 83.22 | |
| VQ-GANSetting=VQ-GAN [13]2025.03 | 37.82 | — | — | — | — | — | — | — | 83.22 | |
| 2-VIS+BLSTM2016.05 | — | 58.2 | 44.8 | 49.5 | 47.3 | 55.1 | 65.3 | 88.6 | — | |
| Hierarchical Question-Image Co-AttentionBackbone=VGG, Mechanism=Alternating Co-attention2016.05 | — | 65.6 | 49.6 | 61.5 | 56.8 | 63.3 | 73 | 91.3 | — | |
| Hierarchical Question-Image Co-AttentionBackbone=VGG, Mechanism=Parallel Co-attention2016.05 | — | 65.6 | 48.9 | 59.8 | 56.7 | 62.9 | 72.8 | 91.3 | — | |
| Hierarchical Question-Image Co-AttentionBackbone=ResNet, Mechanism=Alternating Co-attention2016.05 | — | 68 | 51 | 62.9 | 58.8 | 65.4 | 75.1 | 92 | — | |
| IMG-CNN2016.05 | — | — | — | — | — | 58.4 | 68.5 | 89.7 | — | |
| SAN(2, CNN)2016.05 | — | 64.5 | 48.6 | 57.9 | 54 | 61.6 | 71.6 | 90.9 | — |