Science Question Answering on ScienceQA (SQA)
97.4AccuracyGPT-5-high
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5-highSize=-2026.06 | 97.4 | — | |
| Gemini-2.5-ProSize=-2026.06 | 96.2 | — | |
| LLaVA-OneVision-1.5Size=8B2026.06 | 95 | — | |
| CoLTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 92.8 | — | |
| FP16Backbone=Qwen3-VL-8B2026.06 | 92.76 | — | |
| SharQBackbone=Qwen3-VL-8B2026.06 | 91.96 | — | |
| Qwen3-VL (Textual reasoning)Size=8B2026.06 | 91.8 | — | |
| NVFP4Backbone=Qwen3-VL-8B2026.06 | 91.58 | — | |
| SIM-CoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 90.8 | — | |
| LVRSize=7B2026.06 | 90.2 | — | |
| SoftCoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 89.5 | — | |
| Qwen2.5-VLLLM=Qwen2.5-7B, Number of Parameters=~7B2026.02 | 88.8 | — | |
| PIO-FVLMToken Budget=Retain 33.30% Tokens, Venue=Ours, Backbone=Qwen-2.5-VL-7B2026.02 | 88.7 | — | |
| VanillaToken Budget=1296 Tokens (Upper Bound), Backbone=Qwen-2.5-VL-7B2026.02 | 88.65 | — | |
| CODISize=8B, Backbone=Qwen3-VL-8B2026.06 | 88.4 | — | |
| PIO-FVLMToken Budget=Retain 22.2% Tokens, Venue=Ours, Backbone=Qwen-2.5-VL-7B2026.02 | 88 | — | |
| Multimodal CoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 87.8 | — | |
| ICoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 87.6 | — | |
| ToolTreeBackbone Model=GPT-4o2026.03 | 87.33 | — | |
| CCoTSize=8B, Backbone=Qwen3-VL-8B2026.06 | 87 | — | |
| Qwen3-VL (Direct answer)Size=8B2026.06 | 85.3 | — | |
| DARTToken Budget=Retain 33.30% Tokens, Venue=EMNLP'25, Backbone=Qwen-2.5-VL-7B2026.02 | 84.88 | — | |
| PIO-FVLMToken Budget=Retain 11.1% Tokens, Venue=Ours, Backbone=Qwen-2.5-VL-7B2026.02 | 84.8 | — | |
| ToolTreeBackbone Model=GPT-4o-mini2026.03 | 84.28 | — | |
| DARTToken Budget=Retain 22.2% Tokens, Venue=EMNLP'25, Backbone=Qwen-2.5-VL-7B2026.02 | 84.2 | — | |
| OctoToolsBackbone Model=GPT-4o2026.03 | 84.13 | — | |
| Few-ShotBackbone Model=GPT-4o2026.03 | 82.15 | — | |
| DARTToken Budget=Retain 11.1% Tokens, Venue=EMNLP'25, Backbone=Qwen-2.5-VL-7B2026.02 | 82 | — | |
| DragonflyLLM=Vicuna-7B, Resolution=2016 × 20162026.04 | 79.7 | — | |
| PRINMIXα=1/16, Backbone Model=Qwen2.5-VL-Instruct2025.06 | 79.4 | — | |
| LLaVA-1.5-HDLLM=Vicuna-7B, Resolution=672 × 10242026.04 | 79.3 | — | |
| HuggingGPTBackbone Model=GPT-4o2026.03 | 78.45 | — | |
| OctoToolsBackbone Model=GPT-4o-mini2026.03 | 78.29 | — | |
| Alignedα=1, Backbone Model=Qwen2.5-VL-Instruct2025.06 | 76.7 | — | |
| VanillaBackbone=Qwen-2.5-VL-7B, Token Retention Rate=100%2026.02 | 76.7 | — | |
| Align-TILLM=Qwen3-1.7B, Number of Parameters=~2B, Distillation=true2026.02 | 76.5 | — | |
| Delta-CoMeα=1/16, Backbone Model=Qwen2.5-VL-Instruct2025.06 | 76.5 | — | |
| Few-ShotBackbone Model=GPT-4o-mini2026.03 | 76.5 | — | |
| MiniCPM-V-2LLM=MiniCPM-2.4B, Number of Parameters=~3B2026.02 | 76.3 | — | |
| VisionZipBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 76.3 | — | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 75.4 | — | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 75.1 | — | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 75 | — | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 75 | — | |
| ApETBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 74.9 | — | |
| VanillaBase Model=LLaVA-1.5-13B, Retain Tokens=576, Retention Ratio=100%2026.06 | 74.9 | — | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 74.9 | — | |
| MobileVLM V2LLM=Vicuna-7B, Number of Parameters=~7B2026.02 | 74.8 | — | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 74.7 | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=false2024.12 | 74.4 | — | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 74.2 | — | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 74.2 | — | |
| VisionZipBackbone=Qwen-2.5-VL-7B, Token Retention Rate=10%2026.02 | 74.1 | — | |
| ApETBackbone=Qwen-2.5-VL-7B, Token Retention Rate=10%2026.02 | 74.1 | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=false2024.12 | 74 | — | |
| SparseVLMFLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 73.97 | — | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 73.6 | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=false2024.12 | 73.5 | — | |
| VIFLLM=Vicuna-7B, Resolution=336 × 3362026.04 | 73.5 | — | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 73.1 | — | |
| SparseVLMFLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 73.08 | — | |
| DivpruneFLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 73.08 | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=true2024.12 | 73 | — | |
| iGVLMLLM=Qwen2.5-3B2026.03 | 73 | — | |
| ASAPFLOPs=1.253, Ratio=31.88, Retained Tokens=1922026.03 | 72.89 | — | |
| ASAPFLOPs=0.797, Ratio=20.901, Retained Tokens=1282026.03 | 72.89 | — | |
| VanillaBase Model=LLaVA 1.5 13B, Tokens Retained=576, Projector Fine-tuning=false2024.12 | 72.8 | — | |
| DivpruneFLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 72.78 | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=true2024.12 | 72.7 | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=true2024.12 | 72.3 | — | |
| LLaVA-1.5LLM=Qwen2.5-3B2026.03 | 72.2 | — | |
| PO+PDBackbone=LLaVA-v1.5-13B2025.11 | 72.2 | — | |
| SINEPROJECT(PO+PD)Backbone=LLaVA-v1.5-13B2025.11 | 72.1 | — | |
| PruMerge+FLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 71.89 | — | |
| SparseVLMBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 71.6 | — | |
| LLaVA-1.5LLM=Vicuna-13B2026.03 | 71.6 | — | |
| DyFoLLM=Vicuna-13B2026.03 | 71.6 | — | |
| LLaVA-1.5-13BFLOPs=3.817, Ratio=100%, Retained Tokens=Vanilla2026.03 | 71.6 | — | |
| VanillaBackbone=LLaVA-v1.5-13B2025.11 | 71.6 | — | |
| iGVLMLLM=Vicuna-13B2026.03 | 71.5 | — | |
| Align-TILLM=Qwen2-1.5B, Number of Parameters=~2B, Distillation=true2026.02 | 71.4 | — | |
| QA-ViTLLM=Vicuna-13B2026.03 | 71.3 | — | |
| PruMerge+FLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 71.1 | — | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=64, Fine-tuning Protocol=Fine-tuned multimodal projector2024.12 | 71 | 100.4 | |
| PDropBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 70.9 | — | |
| POBackbone=LLaVA-v1.5-13B2025.11 | 70.9 | — | |
| HuggingGPTBackbone Model=GPT-4o-mini2026.03 | 70.82 | — | |
| Vanilla 7BBase Model=mini-Gemini 7B, Number of Tokens=576, Protocol=Upper Bound2024.12 | 70.7 | 100 | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=642024.12 | 70.7 | 100 | |
| FastVFLOPs=1.259, Ratio=32.99, Retained Tokens=1922026.03 | 70.64 | — | |
| FastV+RandomRetained Tokens=64, Reduction Ratio=88.9%2025.12 | 70.6 | — | |
| FastV+VTWRetained Tokens=64, Reduction Ratio=88.9%2025.12 | 70.4 | — | |
| FastVFLOPs=0.836, Ratio=21.898, Retained Tokens=1282026.03 | 70.32 | — | |
| LLaVA-NeXT-7BRetained Tokens=28802025.09 | 70.2 | — | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=192, Fine-tuning Protocol=Fine-tuned multimodal projector2024.12 | 70.2 | 99.3 | |
| IGVALLM=Vicuna-7B, Resolution=336 × 3362026.04 | 70.2 | — | |
| LLaVA-NextLLM=Vicuna-7B, Number of Parameters=~7B2026.02 | 70.1 | — | |
| VanillaBackbone=LLaVA-NeXT-7B, Token Budget=2880 Tokens, Venue=-2026.02 | 70.1 | — | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=1922024.12 | 70.1 | 99.2 | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=128, Fine-tuning Protocol=Fine-tuned multimodal projector2024.12 | 70.1 | 99.2 |