Visual Question Answering on VQAT
0.736AccuracyDragonfly
Evaluation Results
| Method | Links | |
|---|---|---|
| DragonflyBackbone=Llama3-8B, #Data=2.9M2024.06 | 0.736 | |
| VILA2-8BLLM Parameters=8B, Vision Tower Parameters=400M, Tokens per image=196, Pre-training data size=51M2024.07 | 0.734 | |
| Idefics2-8BLLM Parameters=8B, Vision Tower Parameters=400M, Tokens per image=320, Pre-training data size=>600M2024.07 | 0.73 | |
| MM1-7B-ChatLLM Parameters=7B, Vision Tower Parameters=300M, Tokens per image=720, Pre-training data size=>2B2024.07 | 0.728 | |
| CogVLM-13B-ChatBackbone=Vicuna-7B, #Data=>1.5B2024.06 | 0.704 | |
| LLaVA-UHDBackbone=Vicuna-13B, #Data=1.2M2024.06 | 0.677 | |
| LLaVA-NeXTBackbone=Vicuna-13B, #Data=1.2M2024.06 | 0.671 | |
| VILABackbone=Llama2-13B, #Data=51M2024.06 | 0.666 | |
| Qwen-VLObserved in training=true2024.02 | 0.638 | |
| LLaVA-1.5Backbone=Vicuna-13B, #Data=1.2M2024.06 | 0.613 | |
| LLaVA-1.5 + QA-ViTObserved in training=true2024.02 | 0.591 | |
| InternVL-13BBackbone=Vicuna-13B, #Data=6B2024.06 | 0.587 | |
| LLaVA-1.5-7BVision Token=5762026.06 | 0.582 | |
| DARTVision Token=1922026.06 | 0.574 | |
| LLaVA-1.5Observed in training=true2024.02 | 0.574 | |
| FitPruneVision Token=1922026.06 | 0.574 | |
| MS-ResamplerVision Token=1442026.06 | 0.572 | |
| MustDropVision Token=1922026.06 | 0.565 | |
| PDropVision Token=1922026.06 | 0.561 | |
| SparseVLMVision Token=1922026.06 | 0.561 | |
| VanillaVision Token=576, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 0.547 | |
| LLaVA-PruMergeVision Token=1922026.06 | 0.543 | |
| mPLUG-DocOwlObserved in training=true2024.02 | 0.526 | |
| FastVVision Token=1922026.06 | 0.525 | |
| MS-ResamplerVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 0.524 | |
| TokenPackerVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 0.517 | |
| Pixel-ShuffleVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 0.513 | |
| LDP-v2Vision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 0.511 | |
| InstructBLIPBackbone=Vicuna-13B, #Data=130M2024.06 | 0.507 | |
| C-AbstractorVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 0.48 | |
| HiREDVision Token=1922026.06 | 0.474 | |
| InstructBLIPOCR tokens=true2024.02 | 0.466 | |
| InstructBLIP2024.02 | 0.309 | |
| IDEFICS-80B2024.02 | 0.309 | |
| IDEFICS-9B2024.02 | 0.259 | |
| OpenFlamingo-9B2024.02 | 0.242 | |
| BLIP22024.02 | 0.234 |