Scientific Question Answering on ScienceQA image
98AccuracyInternVL2.5-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2.5-8BBase Model=InternVL2.5-8B, Token Reduction Ratio=0%2026.04 | 98 | |
| FastVBase Model=InternVL2.5-8B, Token Reduction Ratio=77.8%2026.04 | 95.3 | |
| ID-SelectionBase Model=InternVL2.5-8B, Token Reduction Ratio=77.8%, Importance Source=LLM second-layer cross-modal attention2026.04 | 94.4 | |
| DARTBase Model=InternVL2.5-8B, Token Reduction Ratio=77.8%2026.04 | 93.8 | |
| ID-SelectionBase Model=InternVL2.5-8B, Token Reduction Ratio=88.9%, Importance Source=LLM second-layer cross-modal attention2026.04 | 92.7 | |
| DARTBase Model=InternVL2.5-8B, Token Reduction Ratio=88.9%2026.04 | 89.4 | |
| FastVBase Model=InternVL2.5-8B, Token Reduction Ratio=88.9%2026.04 | 88.8 | |
| Qwen2.5-VL-7BToken Budget=100%2025.08 | 87.4 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 87 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 86.6 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 85.7 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 85.2 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=11.1%2025.08 | 82.8 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=11.1%2025.08 | 82.8 | |
| S-MFTLanguage Model Backbone=Qwen2.5-14B, Vision Encoder=SigLIP-ViT-Large2025.12 | 80.4 | |
| Qwen2.5-VL-3BToken Budget=100%2025.08 | 80.4 | |
| FFTLanguage Model Backbone=Qwen2.5-14B, Vision Encoder=SigLIP-ViT-Large2025.12 | 80.1 | |
| PRISM-Qwen-7B (Instruct)Model=PRISM-Qwen-7B (Instruct)2025.02 | 80.1 | |
| HiPruneBase Model=Qwen2.5-VL-3B, Token Budget=22.2%2025.08 | 80 | |
| HiPruneBase Model=Qwen2.5-VL-3B, Token Budget=33.3%2025.08 | 79.8 | |
| HiPrune++Base Model=Qwen2.5-VL-3B, Token Budget=22.2%2025.08 | 79.8 | |
| HiPrune++Base Model=Qwen2.5-VL-3B, Token Budget=33.3%2025.08 | 79.7 | |
| HiPruneBase Model=Qwen2.5-VL-3B, Token Budget=11.1%2025.08 | 79.4 | |
| LoRALanguage Model Backbone=Qwen2.5-14B, Vision Encoder=SigLIP-ViT-Large2025.12 | 79.1 | |
| HiPrune++Base Model=Qwen2.5-VL-3B, Token Budget=11.1%2025.08 | 79.1 | |
| PRISM-Qwen-7B (Base)Model=PRISM-Qwen-7B (Base)2025.02 | 78.9 | |
| TwigVLMTokens Retained Percentage=22.2%2025.03 | 78.1 | |
| TwigVLMTokens Retained Percentage=33.3%2025.03 | 77.9 | |
| LLaVA-Qwen-7B (Instruct)Model=LLaVA-Qwen-7B (Instruct)2025.02 | 77.8 | |
| PRISM-Llama-8BModel=PRISM-Llama-8B2025.02 | 77.3 | |
| ID-SelectionBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=77.8%, Importance Source=LLM second-layer cross-modal attention2026.04 | 77.1 | |
| VisionZipTokens Retained Percentage=33.3%2025.03 | 77.1 | |
| TwigVLM++Tokens Retained Percentage=22.2%2025.03 | 77.1 | |
| TwigVLM++Tokens Retained Percentage=33.3%2025.03 | 77 | |
| VisionZipTokens Retained Percentage=22.2%2025.03 | 77 | |
| LLaVA-Qwen-7B (Base)Model=LLaVA-Qwen-7B (Base)2025.02 | 76.7 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=0%2026.04 | 76.6 | |
| VisionZipTokens Retained Percentage=11.1%2025.03 | 76.1 | |
| TwigVLM++Tokens Retained Percentage=11.1%2025.03 | 76.1 | |
| ID-SelectionBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=88.9%, Importance Source=LLM second-layer cross-modal attention2026.04 | 75.5 | |
| FastVTokens Retained Percentage=33.3%2025.03 | 75.5 | |
| Q2.5VL-7BTokens Retained Percentage=100%2025.03 | 75.3 | |
| FastVTokens Retained Percentage=22.2%2025.03 | 75.3 | |
| DARTBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=77.8%2026.04 | 75.2 | |
| LLaVA-Llama-8BModel=LLaVA-Llama-8B2025.02 | 75.2 | |
| TwigVLMTokens Retained Percentage=11.1%2025.03 | 74.9 | |
| FastVBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=77.8%2026.04 | 74 | |
| FastVTokens Retained Percentage=11.1%2025.03 | 72.8 | |
| PRISM-3BModel=PRISM-3B2025.02 | 72.8 | |
| LLaVA-Phi2-3BModel=LLaVA-Phi2-3B2025.02 | 72.7 | |
| DARTBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=88.9%2026.04 | 72.6 | |
| S-MFT AttnBackbone=Phi-2-2.7B, Epoch=0.46, Time (h)=5.212025.12 | 72.4 | |
| S-MFT BothBackbone=Phi-2-2.7B, Epoch=0.64, Time (h)=8.122025.12 | 72.4 | |
| M3#Vision Tokens=1802026.03 | 72.1 | |
| FastVBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=88.9%2026.04 | 72 | |
| FFTBackbone=Phi-2-2.7B, Epoch=0.86, Time (h)=13.532025.12 | 71.9 | |
| PRISM-13BModel=PRISM-13B2025.02 | 71.8 | |
| S-MFT MLPBackbone=Phi-2-2.7B, Epoch=0.54, Time (h)=7.332025.12 | 71.7 | |
| LLaVA-Vicuna-13BModel=LLaVA-Vicuna-13B2025.02 | 71.6 | |
| LoRABackbone=Phi-2-2.7B, Epoch=0.67, Time (h)=8.152025.12 | 71.1 | |
| ICONSTraining Data Percentage=20%, Data Selection Constraint=Full Data Used before Selection2026.04 | 70.8 | |
| FMVR-LLaVA#Vision Tokens=28802026.03 | 70.6 | |
| Uni-LoRABackbone=Phi-2-2.7B, Epoch=0.72, Time (h)=9.942025.12 | 70.3 | |
| FMVR-LLaVA#Vision Tokens=7202026.03 | 70.3 | |
| PyramidDrop#Vision Tokens=1922026.03 | 70.2 | |
| LLaVA-NeXT-7BRetained Tokens=2880, Base Model=LLaVA-NeXT-7B2025.03 | 70.2 | |
| TwigVLM++Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 70.2 | |
| LLaVA-NeXT-7BRetained Tokens=2880, Base Model=LLaVA-NeXT-7B2025.03 | 70.2 | |
| TwigVLM++Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 70.2 | |
| PDropRetained Tokens=1282026.03 | 70.1 | |
| FastVRetained Tokens=642026.03 | 70.1 | |
| LLaVA-NeXT-7BBase Model=LLaVA-NeXT-7B, Retained Tokens=2880, Pruning Ratio=100%2026.04 | 70.1 | |
| FMVR-LLaVA#Vision Tokens=92026.03 | 69.9 | |
| TwigVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 69.9 | |
| TwigVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 69.9 | |
| FastVVTR Type=Text-aware, Tokens Retained=64, Reduction Ratio=11.1%2026.06 | 69.9 | |
| FMVR-LLaVA#Vision Tokens=1442026.03 | 69.7 | |
| SparseVLMVTR Type=Text-aware, Tokens Retained=64, Reduction Ratio=11.1%2026.06 | 69.7 | |
| LoRA-OneBackbone=Phi-2-2.7B, Epoch=0.60, Time (h)=7.692025.12 | 69.6 | |
| HoloV + RESTOREVTR Type=Text-agnostic, Tokens Retained=192, Reduction Ratio=33.3%2026.06 | 69.6 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Visual Token Budget=5762026.07 | 69.6 | |
| FlashVLMToken Budget=128 Tokens, Pruning Rate=77.8%2025.12 | 69.5 | |
| LLaVA-1.5-7BRetained Tokens=5762026.03 | 69.5 | |
| PruMerge+Retained Tokens=642026.03 | 69.5 | |
| FMVR-LLaVA#Vision Tokens=362026.03 | 69.5 | |
| LLaVA-1.5-7BVTR Type=N/A, Tokens Retained=576, Reduction Ratio=100%2026.06 | 69.5 | |
| VisPruner + RESTOREVTR Type=Text-agnostic, Tokens Retained=192, Reduction Ratio=33.3%2026.06 | 69.5 | |
| PDropVTR Type=Text-aware, Tokens Retained=64, Reduction Ratio=11.1%2026.06 | 69.5 | |
| VisionZipVTR Type=Text-agnostic, Tokens Retained=64, Reduction Ratio=11.1%2026.06 | 69.5 | |
| PruMerge+Backbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 69.5 | |
| PruMerge+Backbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 69.5 | |
| AnchorPruneBackbone=LLaVA-1.5-7B, Visual Token Budget=322026.07 | 69.5 | |
| LLaVA1.5-7B2026.01 | 69.4 | |
| LEVI2026.01 | 69.4 | |
| QLoRABackbone=Phi-2-2.7B, Epoch=0.72, Time (h)=11.182025.12 | 69.4 | |
| FlashVLMToken Budget=32 Tokens, Pruning Rate=94.4%2025.12 | 69.4 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 69.4 | |
| SPHINX-13B2026.01 | 69.3 | |
| FlashVLMToken Budget=64 Tokens, Pruning Rate=88.9%2025.12 | 69.3 | |
| SPHINX#Vision Tokens=2892026.03 | 69.3 |