Video Question Answering on AGQA 2.0
62.27Object-relation AccuracyTGB-BLIP2
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| TGB-BLIP2Model Category=Open-ended Video-Language Models, Augmented=Temporal Grounding Bridge2024.02 | 62.27 | 51.74 | 66.09 | 53.67 | 60.11 | 60.85 | 36.99 | 0 | 61.45 | |
| BLIP2Model Category=Open-ended Video-Language Models2024.02 | 53.72 | 48.64 | 62.1 | 43.84 | 55.94 | 55.14 | 40.39 | 0.28 | 54 | |
| SINGULARITY + TGBModel Category=Retrieval-based Video-Language Models, Augmented=Temporal Grounding Bridge2024.02 | 52.33 | 54.12 | 55.07 | 40.71 | 54.49 | 57.88 | 48.35 | 12.24 | 53.13 | |
| VIOLET + TGBModel Category=Retrieval-based Video-Language Models, Augmented=Temporal Grounding Bridge2024.02 | 51.59 | 54.54 | 56.96 | 40.94 | 55.61 | 59.12 | 42.81 | 9.02 | 52.59 | |
| MIST-AIOModel Category=Retrieval-based Video-Language Models2024.02 | 51.43 | 54.67 | 55.37 | 41.34 | 53.14 | 53.49 | 47.48 | 20.18 | 50.96 | |
| SeViLAModel Category=Open-ended Video-Language Models, Status=Re-implementation result2024.02 | 51.15 | 48.93 | 62.08 | 42.24 | 55.96 | 53.02 | 38.91 | 0 | 51.7 | |
| ALBEF + TGBModel Category=Retrieval-based Video-Language Models, Augmented=Temporal Grounding Bridge2024.02 | 51.05 | 51.11 | 51.66 | 38.36 | 51.33 | 58.1 | 49.2 | 11.78 | 51.73 | |
| VIOLETModel Category=Retrieval-based Video-Language Models2024.02 | 50.89 | 50.24 | 50.93 | 40.76 | 50.51 | 58.07 | 38.97 | 6.53 | 51.03 | |
| SINGULARITYModel Category=Retrieval-based Video-Language Models2024.02 | 50.87 | 50.67 | 49.7 | 40.47 | 40.79 | 55.34 | 48.2 | 11.59 | 51.11 | |
| ALBEFModel Category=Retrieval-based Video-Language Models2024.02 | 50.53 | 49.39 | 49.97 | 38.22 | 49.79 | 54.11 | 48.01 | 10.4 | 50.68 | |
| ATPModel Category=Retrieval-based Video-Language Models2024.02 | 50.15 | 49.76 | 46.25 | 39.78 | 48.25 | 51.79 | 49.59 | 18.96 | 49.79 | |
| AIOModel Category=Retrieval-based Video-Language Models2024.02 | 48.34 | 48.99 | 49.66 | 37.53 | 49.61 | 50.81 | 45.36 | 18.97 | 48.59 | |
| HCRNModel Category=Retrieval-based Video-Language Models2024.02 | 40.33 | 49.86 | 49.85 | 33.55 | 49.7 | 50.01 | 43.84 | 5.52 | 42.11 | |
| PSACModel Category=Retrieval-based Video-Language Models2024.02 | 37.84 | 49.95 | 50 | 33.2 | 49.78 | 49.94 | 45.21 | 4.14 | 40.18 | |
| HMEModel Category=Retrieval-based Video-Language Models2024.02 | 37.42 | 49.9 | 49.97 | 33.21 | 49.77 | 49.96 | 47.03 | 5.43 | 39.89 |