ResearchBenchmarksMulti-task Image-Text Understanding on VQAv2, GQA, NLVR2, and COCO CaptionFollow66.9VQAv2 AccuracyFT65.13265.59166.0566.509Feb 14, 2024Evaluation ResultsMethodMethodLinksVQAv2 AccuracyGQA AccuracyNLVR2 AccuracyCOCO Caption ScoreAverage ScoreFT#Params (%)=100, Backb...#Params (%)=100, Backbone=VL-BART2024.0266.956.773.711277.3DoRA#Params (%)=5.96, Back...#Params (%)=5.96, Backbone=VL-BART2024.0265.854.773.1115.977.4LoRA#Params (%)=5.93, Back...#Params (%)=5.93, Backbone=VL-BART2024.0265.253.671.9115.376.5