Visual Question Answering on VizWiz (Accuracy)
71.7AccuracyOp-Skip
Evaluation Results
| Method | Links | |
|---|---|---|
| Op-SkipBackbone=Qwen3-VL-8B, TFLOPs=66%, N=202026.06 | 71.7 | |
| BF16Model=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=BF162026.06 | 71.64 | |
| VanillaBackbone=Qwen2.5-VL-7B, TFLOPs=100%2026.06 | 70.81 | |
| BF16Model=Kimi-VL-A3B-Instruct, Avg-Bit=BF162026.06 | 70.59 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B2026.06 | 70.2 | |
| V2DropBackbone=Qwen3-VL-8B, TFLOPs=66%2026.06 | 69.78 | |
| ShortVBackbone=Qwen3-VL-8B, TFLOPs=58%, N=202026.06 | 69.61 | |
| MODEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 69.42 | |
| VanillaBackbone=Qwen3-VL-8B, TFLOPs=100%2026.06 | 69.37 | |
| APETBackbone=Qwen2.5-VL-7B, TFLOPs=55%2026.06 | 69.02 | |
| MODEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 68.82 | |
| APETBackbone=Qwen3-VL-8B, TFLOPs=66%2026.06 | 68.82 | |
| V2DropBackbone=Qwen2.5-VL-7B, TFLOPs=55%2026.06 | 68.68 | |
| VSkipBackbone=Qwen3-VL-8B, TFLOPs=76%, N=202026.06 | 68.49 | |
| VTWBase Model=Qwen2.5-VL-7B, Hyperparameter (K/N)=K=72026.06 | 66.4 | |
| V-SkipBase Model=Qwen2.5-VL-7B, Hyperparameter (K/N)=N=72026.06 | 66.4 | |
| VEQ-MEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 66.39 | |
| VEQ-MEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 66.02 | |
| MC-MoEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 65.55 | |
| Op-SkipBackbone=Qwen2.5-VL-7B, TFLOPs=55%, N=202026.06 | 65.48 | |
| Speed-QModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 65.11 | |
| MoEQuantModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 64.71 | |
| MBQModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 64.52 | |
| MODEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W22026.06 | 64.52 | |
| MC-MoEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 64.42 | |
| MBQModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 63.91 | |
| Speed-QModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 63.89 | |
| VSkipBackbone=Qwen2.5-VL-7B, TFLOPs=67%, N=162026.06 | 63.85 | |
| CoresetBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 63.76 | |
| LLaVA-NeXT-13BBase Model=LLaVA-NeXT-13B2026.06 | 63.6 | |
| MoEQuantModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 63.56 | |
| MODEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 63.39 | |
| V-SkipBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=N=242026.06 | 62.9 | |
| GPTQModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 62.63 | |
| Reasoning-onlyBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 62.45 | |
| GPTQModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 62.07 | |
| RECAPBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 61.97 | |
| LLaVA-NeXT-7BBase Model=LLaVA-NeXT-7B2026.06 | 60.6 | |
| VEQ-MEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 59.95 | |
| VTWBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=K=162026.06 | 59.6 | |
| V-SkipBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=N=192026.06 | 59.3 | |
| ShortVBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=N=242026.06 | 59.2 | |
| VTWBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=K=202026.06 | 58.5 | |
| MC-MoEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W22026.06 | 58.26 | |
| ShortVBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=N=192026.06 | 57.7 | |
| V-SkipBase Model=LLaVA-1.5-13B, Hyperparameter (K/N)=N=242026.06 | 57.3 | |
| PropMixBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 57.05 | |
| VEQ-MEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W22026.06 | 57.04 | |
| LLaVA-1.5-13BBase Model=LLaVA-1.5-13B2026.06 | 56.6 | |
| ShortVBase Model=LLaVA-1.5-13B, Hyperparameter (K/N)=N=242026.06 | 56.6 | |
| MC-MoEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 55.32 | |
| VTWBase Model=LLaVA-1.5-13B, Hyperparameter (K/N)=K=202026.06 | 55.1 | |
| VTWBackbone=Qwen3-VL-8B, TFLOPs=58%, K=162026.06 | 54.81 | |
| V-SkipBase Model=LLaVA-1.5-7B, Hyperparameter (K/N)=N=192026.06 | 54.5 | |
| LLaVA-1.5-7BBase Model=LLaVA-1.5-7B2026.06 | 54.3 | |
| VSkip+Backbone=LLaVA-1.5-7B, TFLOPs=76%, N=202026.06 | 54.16 | |
| VanillaBackbone=LLaVA-1.5-7B, TFLOPs=100%2026.06 | 54.09 | |
| UniformBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 54.05 | |
| AgilePruneBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 54 | |
| VSkipBackbone=LLaVA-1.5-7B, TFLOPs=76%, N=202026.06 | 53.95 | |
| MoEQuantModel=Kimi-VL-A3B-Instruct, Avg-Bit=W22026.06 | 53.69 | |
| DivPruneBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 53.6 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 53.5 | |
| AgilePruneBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 53.4 | |
| DivPruneBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 53.3 | |
| APETBackbone=LLaVA-1.5-7B, TFLOPs=66%2026.06 | 53.23 | |
| Vision-R1-7B2025.10 | 53.12 | |
| LwFBackbone=Qwen2.5-VL-7B, Training=finetuned2025.10 | 53.12 | |
| AgilePruneBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 53 | |
| STSBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 53 | |
| TPCIntegration Strategy=Ours (core–residual alignment), Base LVLM=LLaVA-1.5-7B2026.07 | 52.94 | |
| OpenVLThinker-7B2025.10 | 52.89 | |
| VTWBackbone=Qwen2.5-VL-7B, TFLOPs=50%, K=162026.06 | 52.86 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 52.8 | |
| DivPruneBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 52.8 | |
| Op-SkipBackbone=LLaVA-1.5-7B, TFLOPs=66%, N=202026.06 | 52.75 | |
| STSBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 52.7 | |
| ToMeToken Budget=64, Base Model=LLaVA-1.5-7B2026.06 | 52.6 | |
| V2DropBackbone=LLaVA-1.5-7B, TFLOPs=66%2026.06 | 52.56 | |
| STSBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 52.5 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 52.5 | |
| VisionZipBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 52.4 | |
| Patch-Aligned TrainingIntegration Strategy=Projector / fine-grained alignment (LVLM-side training), Base LVLM=LLaVA-1.5-7B2026.07 | 52.3 | |
| VisPrunerToken Budget (K)=64, Token Reduction (%)=↓ 88.9%, Model Backbone=LLaVA-1.5-7B2026.06 | 52.2 | |
| VisionZipBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 51.9 | |
| ToMeToken Budget=128, Base Model=LLaVA-1.5-7B2026.06 | 51.6 | |
| PriorTRToken Budget (K)=64, Token Reduction (%)=↓ 88.9%, Model Backbone=LLaVA-1.5-7B2026.06 | 51.5 | |
| SparseVLMToken Budget (K)=128, Token Reduction (%)=↓ 77.8%, Model Backbone=LLaVA-1.5-7B2026.06 | 51.4 | |
| SparseVLMToken Budget=128, Base Model=LLaVA-1.5-7B2026.06 | 51.4 | |
| Adv-W2SIntegration Strategy=Robust vision encoder replacement, Base LVLM=LLaVA-1.5-7B2026.07 | 51.4 | |
| FastVToken Budget (K)=128, Token Reduction (%)=↓ 77.8%, Model Backbone=LLaVA-1.5-7B2026.06 | 51.3 | |
| PriorTRToken Budget (K)=128, Token Reduction (%)=↓ 77.8%, Model Backbone=LLaVA-1.5-7B2026.06 | 51.3 | |
| FastVToken Budget=128, Base Model=LLaVA-1.5-7B2026.06 | 51.3 | |
| HiREDToken Budget=128, Base Model=LLaVA-1.5-7B2026.06 | 51.3 | |
| VisPrunerToken Budget (K)=128, Token Reduction (%)=↓ 77.8%, Model Backbone=LLaVA-1.5-7B2026.06 | 51.2 | |
| PDropToken Budget (K)=192, Token Reduction (%)=↓ 66.7%, Model Backbone=LLaVA-1.5-7B2026.06 | 51.1 | |
| PDropToken Budget=192, Base Model=LLaVA-1.5-7B2026.06 | 51.1 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 51 | |
| VTWBase Model=LLaVA-1.5-7B, Hyperparameter (K/N)=K=162026.06 | 51 | |
| PDropToken Budget (K)=128, Token Reduction (%)=↓ 77.8%, Model Backbone=LLaVA-1.5-7B2026.06 | 51 |