ResearchBenchmarksText-to-Video Generation on Multimodal VoxCelebFollow0.197CLIP ScoreMMVID0.192840.193920.1950.19608Mar 4, 2022Evaluation ResultsMethodMethodLinksCLIP ScoreFVDF8 AccuracyF1/8 AccuracyMMVIDCondition=MultimodalCondition=Multimodal2022.030.19746.76397.297.1ART-VCondition=MultimodalCondition=Multimodal2022.030.19360.34295.396