Science Question Answering on ScienceQA SQA-IMG (test)
91.5SQA-IMG AccuracyQwen
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QwenToken Retention Rate=100%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 91.5 | — | |
| HiPruneToken Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 87 | — | |
| VisionZipToken Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 86.5 | — | |
| HiPrune++Token Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 86.5 | — | |
| FastVToken Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 84.4 | — | |
| VisionZipToken Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 83.5 | — | |
| FastVToken Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 82.9 | — | |
| HiPrune++Token Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 82.9 | — | |
| HiPruneToken Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 82.6 | — | |
| HiPruneToken Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 82.6 | — | |
| HiPrune++Token Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 81.8 | — | |
| VisionZipToken Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 81.5 | — | |
| FastVToken Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 78.7 | — | |
| ScalSelectSelection Budget=400K2026.02 | 67.72 | — | |
| Full-FinetuneSelection Budget=625K (Full)2026.02 | 67.63 | — | |
| COINCIDESelection Budget=100K2026.02 | 66.83 | — | |
| ScalSelectSelection Budget=300K2026.02 | 66.53 | — | |
| ScalSelectSelection Budget=200K2026.02 | 65.39 | — | |
| ScalSelectSelection Budget=100K2026.02 | 65.29 | — | |
| RandomSelection Budget=100K2026.02 | 65.2 | — | |
| RDS+Selection Budget=100K2026.02 | 64.45 | — | |
| PRISMSelection Budget=100K2026.02 | 64.06 | — | |
| ScalSelectSelection Budget=50K2026.02 | 63.11 | — | |
| LengthSelection Budget=100K2026.02 | 52.7 | — | |
| PerplexitySelection Budget=100K2026.02 | 48.44 | — | |
| BLIP-2Vision Encoder=ViT-g, Resolution=224, LLM=Vicuna-13B, Data=129M2025.01 | — | 61 | |
| InstructBLIPVision Encoder=ViT-g, Resolution=224, LLM=Vicuna-7B, Data=130M2025.01 | — | 60.5 | |
| InstructBLIPVision Encoder=ViT-g, Resolution=224, LLM=Vicuna-13B, Data=130M2025.01 | — | 63.1 | |
| LLaVA-1.5Vision Encoder=CLIP-L, Resolution=336, LLM=Vicuna-7B, Data=1.2M2025.01 | — | 66.8 | |
| LLaVA-1.5Vision Encoder=CLIP-L, Resolution=336, LLM=Vicuna-13B, Data=1.2M2025.01 | — | 71.6 | |
| LLaVA-HRVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/448, LLM=Vicuna-7B, Data=1.2M2025.01 | — | 65.1 | |
| LLAVA-HRVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/448, LLM=Vicuna-13B, Data=1.2M2025.01 | — | 68.1 | |
| LLaVA-NeXTVision Encoder=CLIP-L, Resolution=1344, LLM=Vicuna-7B, Data=1.6M2025.01 | — | 70.1 | |
| LLaVA-UHDVision Encoder=CLIP-L, Resolution=1008, LLM=Vicuna-13B, Data=1.2M2025.01 | — | 67.7 | |
| LLaVA-UHD v2Vision Encoder=CLIP-L, Resolution=1008, LLM=Vicuna-7B, Data=1.4M2025.01 | — | 67.6 | |
| MG-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, RAMPlus, OWL-ViTv2-L, Resolution=768/336, LLM=Vicuna-7B, Data=2.5M2025.01 | — | 70.8 | |
| MM1Vision Encoder=CLIP-L, Resolution=1792, LLM=7B, Data=1B2025.01 | — | 72.6 | |
| mPLUG-Owl2Vision Encoder=CLIP-L, Resolution=448, LLM=Llama-2-7B, Data=400M2025.01 | — | 68.7 | |
| PIIP-LLaVAVision Encoder=ConvNeXt-B, CLIP-L, Resolution=1024/336, LLM=Vicuna-7B, Data=1.2M2025.01 | — | 68.1 | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-7B, Data=1.2M2025.01 | — | 68.3 | |
| PIIP-LLaVAVision Encoder=ConvNeXt-B, CLIP-L, Resolution=1024/336, LLM=Vicuna-13B, Data=1.2M2025.01 | — | 71.1 | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-13B, Data=1.2M2025.01 | — | 69.8 | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-7B, Data=2.7M2025.01 | — | 95 | |
| QwenVL-ChatVision Encoder=ViT-G, Resolution=448, LLM=Qwen-7B, Data=1.4B2025.01 | — | 68.2 | |
| SlimeVision Encoder=CLIP-L, Resolution=2016, LLM=Vicuna-7B, Data=2M2025.01 | — | 76.8 | |
| SPHINX-intern2Vision Encoder=ConvNeXt-XXL, DINOv2-g, Resolution=448, LLM=InternLM2-7B, Data=16M2025.01 | — | 70.4 |