Visual Question Answering on ScienceQA SQA-I
69.8AccuracyDUET-VLM (C+S)
Evaluation Results
| Method | Links | |
|---|---|---|
| DUET-VLM (C+S)Visual Token Budget=Avg 192 Tokens2026.02 | 69.8 | |
| DUET-VLM (C+S)Visual Token Budget=Avg 64 Tokens2026.02 | 69.8 | |
| DUET-VLM (C)Visual Token Budget=Avg 192 Tokens2026.02 | 69.6 | |
| DUET-VLM (C+all)Visual Token Budget=Avg 192 Tokens2026.02 | 69.6 | |
| LLaVA-1.5-7BVisual Token Budget=Total 576 Tokens2026.02 | 69.5 | |
| DUET-VLM (C)Visual Token Budget=Avg 64 Tokens2026.02 | 69.5 | |
| DUET-VLM (C+S)Visual Token Budget=Avg 128 Tokens2026.02 | 69.3 | |
| VisionZipVisual Token Budget=Avg 64 Tokens2026.02 | 68.8 | |
| LLaVA-1.5 + PADL+ (8×)LLM=Vicuna-7B, Compression Method=PADL, Compression Ratio=8x, Adapter fine-tuning=true2026.06 | 68.8 | |
| LLaVA-1.5 + FreePrunerLLM=Vicuna-7B, Compression Method=FreePruner2026.06 | 68.6 | |
| VisionZipVisual Token Budget=Avg 128 Tokens2026.02 | 68.5 | |
| DUET-VLM (C)Visual Token Budget=Avg 128 Tokens2026.02 | 68.5 | |
| VisionZipVisual Token Budget=Avg 192 Tokens2026.02 | 68.2 | |
| DUET-VLM (C+all)Visual Token Budget=Avg 64 Tokens2026.02 | 68 | |
| DUET-VLM (C+all)Visual Token Budget=Avg 128 Tokens2026.02 | 67.6 | |
| LLaVA-1.5 + PruMergeLLM=Vicuna-7B, Compression Method=PruMerge2026.06 | 67.5 | |
| Qwen-VLLLM=Qwen-7B2026.06 | 67.1 | |
| LLaVA-1.5LLM=Vicuna-7B2026.06 | 66.8 | |
| LLaVA-1.5 + PADL (8×)LLM=Vicuna-7B, Compression Method=PADL, Compression Ratio=8x, Adapter fine-tuning=false2026.06 | 65.5 | |
| InstructBLIPLLM=Vicuna-13B2026.06 | 63.1 | |
| InstructBLIPLLM=Vicuna-7B2026.06 | 60.5 |