Science Question Answering on ScienceQA SQA-I
96.6AccuracyInternVL2-8B + RP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InternVL2-8B + RPRP fine-tuning=Object Replacement Data2024.08 | 96.6 | — | |
| InternVL2-8B-FTRP fine-tuning=None2024.08 | 96.5 | — | |
| TroL-7BParameters=7B2024.06 | 92.8 | — | |
| VILA2-8BLLM Parameters=8B, Vision Tower Parameters=400M, Tokens per image=196, Pre-training data size=51M2024.07 | 87.6 | — | |
| UIO-2-XXL-6.8BParameters=6.8B2024.06 | 86.2 | — | |
| Qwen-2.5-VL-7BSpeedup=1.00×, Token Budget=Dynamic Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 86.2 | — | |
| VisionZipSpeedup=1.3x, Token Budget=Avg 640 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 86.2 | — | |
| VisionZipSpeedup=1.4x, Token Budget=Avg 320 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 86.2 | — | |
| VisionZipSpeedup=1.5x, Token Budget=Avg 160 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 86.1 | — | |
| DUET-VLM (C)Speedup=1.5x, Token Budget=Avg 160 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 86 | — | |
| DUET-VLM (C)Speedup=1.3x, Token Budget=Avg 640 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 85.8 | — | |
| DUET-VLM (C)Speedup=1.4x, Token Budget=Avg 320 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 85.8 | — | |
| SparseVLMBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 74.3 | — | |
| FastVBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 74.2 | — | |
| DARTBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 74.2 | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 74.2 | — | |
| VisPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 74 | — | |
| VisPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 73.9 | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 73.8 | — | |
| DARTBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 73.8 | — | |
| VILA-13BParameters=13B2024.06 | 73.7 | — | |
| LLaVA-NeXT-13BParameters=13B2024.06 | 73.6 | — | |
| MGM-HDLLM=Vicuna-13B, Resolution setting=High resolution2024.05 | 73.5 | — | |
| PruMerge+Backbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 73.5 | — | |
| ZOO-PruneBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 73.4 | — | |
| ERABackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 73.4 | — | |
| PDropBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 73.3 | — | |
| PruMerge+Backbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 73.3 | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 73.2 | — | |
| MGM-HD+CALLLM=Vicuna-13B, Resolution setting=High resolution2024.05 | 73.1 | — | |
| FastVBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 73.1 | — | |
| PDropBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 73.1 | — | |
| SparseVLMBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 73 | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Retained Tokens=576 (Upper Bound)2026.06 | 72.8 | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 72.8 | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 72.8 | — | |
| LLaVA-1.5+CALLLM=Vicuna-13B, Resolution setting=Low resolution2024.05 | 72.7 | — | |
| MM1-7B-ChatLLM Parameters=7B, Vision Tower Parameters=300M, Tokens per image=720, Pre-training data size=>2B2024.07 | 72.6 | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 72.5 | — | |
| ERABackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 72.5 | — | |
| TRIMBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 72.4 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution setting=Low resolution2024.05 | 72.1 | — | |
| LBR (ours)Backbone=LLaVA-1.5, Parameter Scale=13B, LBR Mitigation=true2026.05 | 72.1 | — | |
| ZOO-PruneBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 72.1 | — | |
| TRIMBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 72 | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 72 | — | |
| MGM+CALLLM=Vicuna-13B, Resolution setting=Low resolution2024.05 | 71.9 | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Resolution setting=High resolution2024.05 | 71.8 | — | |
| MGM-7B + RPRP fine-tuning=Object Replacement Data2024.08 | 71.7 | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 71.7 | — | |
| LLaVA1.5-13BParameters=13B2024.06 | 71.6 | — | |
| LLaVA-NeXT-8BParameters=8B2024.06 | 71.6 | — | |
| LLaVA-NeXT+CALLLM=Vicuna-13B, Resolution setting=High resolution2024.05 | 71.5 | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5, Parameter Scale=13B, LBR Mitigation=false2026.05 | 71.5 | — | |
| LBR (ours)Backbone=LLaVA-NEXT, Parameter Scale=3B, LBR Mitigation=true2026.05 | 71.5 | — | |
| LLaVA-NEXT-3BBackbone=LLaVA-NEXT, Parameter Scale=3B, LBR Mitigation=false2026.05 | 71.1 | — | |
| SPHINX-7BParameters=7B2024.06 | 70.6 | — | |
| SPHINX-MoE-7Bx8Architecture=MoE, Parameters=7Bx82024.06 | 70.6 | — | |
| SPHINX-Plus-13BParameters=13B2024.06 | 70.6 | — | |
| MGM-7BRP fine-tuning=None2024.08 | 70.6 | — | |
| MGM+CALLLM=Vicuna-7B, Resolution setting=Low resolution2024.05 | 70.4 | — | |
| LLaVA-NeXT-7BParameters=7B2024.06 | 70.2 | — | |
| Qwen-2.5-VL-3BToken=2562026.03 | 70.2 | — | |
| LLaVA-NeXT-7BVisual tokens retained=Full, Pruning ratio=0%, Base Model=LLaVA-NeXT-7B2026.03 | 70.2 | 100 | |
| VanillaToken Retention Budget=2,880 Tokens (100%), Backbone=LLaVA-NeXT 7B2026.05 | 70.2 | 100 | |
| LLaVA-NeXT+CALLLM=Vicuna-7B, Resolution setting=High resolution2024.05 | 70.1 | — | |
| MGMLLM=Vicuna-7B, Resolution setting=Low resolution2024.05 | 69.9 | — | |
| ResPruneVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 69.5 | 99.6 | |
| Monkey-10BParameters=10B2024.06 | 69.4 | — | |
| LBR (ours)Backbone=LLaVA-1.5, Parameter Scale=7B, LBR Mitigation=true2026.05 | 69.4 | — | |
| MGM-HD+CALLLM=Vicuna-7B, Resolution setting=High resolution2024.05 | 69.2 | — | |
| ResPruneVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 69.2 | 98.1 | |
| MGMLLM=Vicuna-13B, Resolution setting=Low resolution2024.05 | 69.1 | — | |
| mPLUG-Owl2-7BParameters=7B2024.06 | 68.7 | — | |
| LLaVA-1.5+CALLLM=Vicuna-7B, Resolution setting=Low resolution2024.05 | 68.7 | — | |
| TwigVLMToken Retention Budget=320 Tokens (↓ 88.9%), Backbone=LLaVA-NeXT 7B, Params.=610M2026.05 | 68.7 | 96.3 | |
| OccamTokenToken Retention Budget=320 Tokens (↓ 88.9%), Backbone=LLaVA-NeXT 7B2026.05 | 68.7 | 97.3 | |
| LLaVA-NeXTLLM=Vicuna-7B, Resolution setting=High resolution2024.05 | 68.5 | — | |
| Adaptive-VoCoTokens=1−42025.12 | 68.5 | — | |
| OccamTokenToken Retention Budget=160 Tokens (↓ 94.4%), Backbone=LLaVA-NeXT 7B2026.05 | 68.5 | 95.9 | |
| OccamTokenToken Retention Budget=40 Tokens (↓ 98.6%), Backbone=LLaVA-NeXT 7B2026.05 | 68.5 | 93.8 | |
| ShareGPT4V-7BParameters=7B2024.06 | 68.4 | — | |
| MGM-HDLLM=Vicuna-7B, Resolution setting=High resolution2024.05 | 68.4 | — | |
| VisionZipToken Retention Budget=160 Tokens (↓ 94.4%), Backbone=LLaVA-NeXT 7B2026.05 | 68.3 | 89.4 | |
| Qwen-VL-Chat-7BParameters=7B, Variant=Chat2024.06 | 68.2 | — | |
| VILA-7BParameters=7B2024.06 | 68.2 | — | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution setting=Low resolution2024.05 | 68.2 | — | |
| LLaVA-1.5-7B + RPRP fine-tuning=Object Replacement Data2024.08 | 68.2 | — | |
| TPRLToken=144*2026.03 | 68.2 | — | |
| DARTVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 68.2 | 97.5 | |
| VisionZIPVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 68.1 | 98.1 | |
| PruMergeVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 68.1 | 94.1 | |
| PruMergeVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 67.8 | 96.6 | |
| DivPruneVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 67.8 | 97.2 | |
| DARTToken Retention Budget=160 Tokens (↓ 94.4%), Backbone=LLaVA-NeXT 7B2026.05 | 67.8 | 90.6 | |
| TPRLToken=128*2026.03 | 67.7 | — | |
| DivPruneVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 67.7 | 96.6 | |
| DivPruneToken Retention Budget=320 Tokens (↓ 88.9%), Backbone=LLaVA-NeXT 7B2026.05 | 67.7 | 95 | |
| SparseVLMVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 67.6 | 96.9 | |
| DARTVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 67.5 | 94.8 |