Visual Question Answering on MultiDocVQA (val)
49.4ANLSDeepStack-HD+
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DeepStack-HD+LLM=Vicuna-13B, Visual Tokens=14400, Context Length=2880, Pre-training=748K, Instruction-tuning=748K2024.06 | 49.4 | 39.1 | |
| DeepStack-HD+LLM=Vicuna-7B, Visual Tokens=14400, Context Length=2880, Pre-training=558K, Instruction-tuning=748K2024.06 | 48.2 | 37.7 | |
| LLaVA-NextLLM=Vicuna-13B, Visual Tokens=2880, Context Length=2880, Pre-training=558K, Instruction-tuning=765K2024.06 | 46.3 | 32.6 | |
| LLaVA-NextLLM=Vicuna-7B, Visual Tokens=2880, Context Length=2880, Pre-training=558K, Instruction-tuning=765K2024.06 | 44.4 | 31.3 | |
| DeepStack-LLLM=Vicuna-13B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 24.8 | 12.2 | |
| DeepStack-VLLM=Vicuna-13B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 23.5 | 11.2 | |
| DeepStack-VLLM=Vicuna-7B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 23 | 11 | |
| DeepStack-LLLM=Vicuna-7B, Visual Tokens=2880, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 22.2 | 10.5 | |
| LLaVA-1.5LLM=Vicuna-13B, Visual Tokens=576, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 18.3 | 8 | |
| LLaVA-1.5LLM=Vicuna-7B, Visual Tokens=576, Context Length=576, Pre-training=558K, Instruction-tuning=665K2024.06 | 16.7 | 7.2 |