Transition Video Question Answering on TGIF-QA (test)
97.6AccuracyVGT
Evaluation Results
| Method | Links | |
|---|---|---|
| VGTPretrain Dataset=None, Pretrain Size=None, Text Encoder=BERT2023.02 | 97.6 | |
| CoVGTPretrain Dataset=None, Pretrain Size=None, Text Encoder=RoBERTa2023.02 | 97.6 | |
| VGT (PT)Pretrain Dataset=WV, Pretrain Size=0.18M, Text Encoder=BERT2023.02 | 97.2 | |
| MERLOTPretrain Dataset=YT, CC, Pretrain Size=183M, Text Encoder=BERT2023.02 | 96.2 | |
| CoVGT (PT)Pretrain Dataset=WV, Pretrain Size=0.18M, Text Encoder=RoBERTa2023.02 | 96.2 | |
| All-in-one-B [384]Nets=CE, Params=110M, PT Samples=3.72M, Frames=3, Resolution=384x3842022.03 | 95.1 | |
| All-in-one-B *Nets=CE, Params=110M, PT Samples=9.72M, Frames=3, Resolution=224x224, Note=Pre-training with additional YT-Temporal 180M2022.03 | 94.7 | |
| All-in-one-BNets=CE, Params=110M, PT Samples=3.72M, Frames=3, Resolution=224x2242022.03 | 94.3 | |
| All-in-one-BNets=CE, Params=110M, PT Samples=3.72M, Frames=1, Resolution=224x2242022.03 | 94.2 | |
| VIOLETNets=T+V+CE, Params=198M, PT Samples=5.5M, Frames=16, Resolution=224x2242022.03 | 93.6 | |
| All-in-one-SNets=CE, Params=33M, PT Samples=3.72M, Frames=3, Resolution=224x2242022.03 | 92.7 | |
| MHNPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 90.8 | |
| ClipBERTPretrain Dataset=VG, COCO, Pretrain Size=None, Text Encoder=BERT2023.02 | 87.8 | |
| ClipBERTNets=T+V+CE, Params=137M, PT Samples=5.6M, Frames=1x1, Resolution=224x2242022.03 | 87.5 | |
| MASNPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 87.4 | |
| PGATPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 85.7 | |
| HQGAPretrain Dataset=None, Pretrain Size=None, Text Encoder=BERT2023.02 | 85.6 | |
| SiaSReaPretrain Dataset=VG, COCO, Pretrain Size=None, Text Encoder=BERT2023.02 | 85.3 | |
| All-in-one-TiNets=CE, Params=12M, PT Samples=3.72M, Frames=3, Resolution=224x2242022.03 | 83.5 | |
| HOSTRPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 83 | |
| B2APretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 82.6 | |
| HAIRPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 82.3 | |
| HCRNNets=T+V+LSTM, Frames=16, Resolution=224x2242022.03 | 81.4 | |
| HCRNPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 81.4 | |
| LGCNPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 81.1 | |
| QueSTNets=T+V+LSTM, Frames=16, Resolution=224x2242022.03 | 81 | |
| HGAPretrain Dataset=None, Pretrain Size=None, Text Encoder=GloVe2023.02 | 81 | |
| HeterogeneousNets=T+V+LSTM, Frames=35, Resolution=224x2242022.03 | 77.8 |