Visual Question Answering on InfoVQA+ (val)
45.2ANLSDeepStack-HD+
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepStack-HD+LLM=Vicuna-13B, Visual Tokens=14400, Context Length=2880, Pre-training=748K, Instruction-tuning=748K2024.06 | 45.2 | |
| LLaVA-NextLLM=Vicuna-13B, Visual Tokens=2880, Context Length=2880, Pre-training=558K, Instruction-tuning=765K2024.06 | 44.5 | |
| DeepStack-HD+LLM=Vicuna-7B, Visual Tokens=14400, Context Length=2880, Pre-training=558K, Instruction-tuning=748K2024.06 | 41.2 | |
| LLaVA-NextLLM=Vicuna-7B, Visual Tokens=2880, Context Length=2880, Pre-training=558K, Instruction-tuning=765K2024.06 | 37.1 | |
| DeepStack-LLLM=Vicuna-13B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 34 | |
| DeepStack-VLLM=Vicuna-13B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 33.1 | |
| DeepStack-LLLM=Vicuna-7B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 30.1 | |
| DeepStack-VLLM=Vicuna-7B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 30 | |
| LLaVA-1.5LLM=Vicuna-13B, Visual Tokens=576, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 29.4 | |
| LLaVA-1.5LLM=Vicuna-7B, Visual Tokens=576, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 25.8 |