ResearchBenchmarksMultiple-Choice Video Question Answering on NExT-QA (val)Follow69.2AccuracyMoReVQA18.03231.31644.657.884Apr 9, 2024Evaluation ResultsMethodMethodLinksAccuracyMoReVQAVLM=PALI-3 (5B), LLM=P...VLM=PALI-3 (5B), LLM=PaLM-2, Video context=16 uniformly sampled frames2024.0469.2JCEFVLM=PALI-3 (5B), LLM=P...VLM=PALI-3 (5B), LLM=PaLM-2, Video context=1 frame per second2024.0466.7ViperGPT+VLM=PALI-3 (5B), LLM=P...VLM=PALI-3 (5B), LLM=PaLM-22024.0464ViperGPT2024.0460LLM-onlyLLM=PaLM-2LLM=PaLM-22024.0448.5Random (for MC)2024.0420