Text-based Visual Question Answering on TextVQA (Accuracy and Latency)
100Average ScoreVanilla
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VanillaBackbone=LLaVA-1.5-13B, Tokens=322026.01 | 100 | 59.4 | 2,394 | |
| VisionTrimBackbone=LLaVA-1.5-13B, Tokens=322026.01 | 96.3 | 57.6 | 704 | |
| VanillaBackbone=Qwen2.5-VL-7B, Token Retention Rate=100%2025.12 | 76.23 | — | — | |
| FastVBackbone=Qwen2.5-VL-7B, Token Retention Rate=25%2025.12 | 74.65 | — | — | |
| D²PrunerBackbone=Qwen2.5-VL-7B, Token Retention Rate=25%2025.12 | 74.64 | — | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Tokens=322026.01 | 71.4 | 53.6 | 1,096 | |
| D²PrunerBackbone=Qwen2.5-VL-7B, Token Retention Rate=10%2025.12 | 70.54 | — | — | |
| DivPruneBackbone=Qwen2.5-VL-7B, Token Retention Rate=25%2025.12 | 70.43 | — | — | |
| FastVBackbone=Qwen2.5-VL-7B, Token Retention Rate=10%2025.12 | 66.4 | — | — | |
| DARTBackbone=Qwen2.5-VL-7B, Token Retention Rate=25%2025.12 | 64.74 | — | — | |
| S-MFTLanguage Model Backbone=Qwen2.5-7B, Vision Tower=SigLIP-ViT-Large2025.12 | 64.2 | — | — | |
| FFTLanguage Model Backbone=Qwen2.5-7B, Vision Tower=SigLIP-ViT-Large2025.12 | 64 | — | — | |
| LoRALanguage Model Backbone=Qwen2.5-7B, Vision Tower=SigLIP-ViT-Large2025.12 | 63.7 | — | — | |
| S-MFTLanguage Model Backbone=Vicuna-7B, Vision Tower=CLIP-ViT-Large2025.12 | 58.8 | — | — | |
| DivPruneBackbone=Qwen2.5-VL-7B, Token Retention Rate=10%2025.12 | 58.79 | — | — | |
| FFTLanguage Model Backbone=Vicuna-7B, Vision Tower=CLIP-ViT-Large2025.12 | 58.4 | — | — | |
| LoRALanguage Model Backbone=Vicuna-7B, Vision Tower=CLIP-ViT-Large2025.12 | 58.3 | — | — | |
| FFTLanguage Model Backbone=LLaMA2-7B, Vision Tower=CLIP-ViT-Large2025.12 | 57.7 | — | — | |
| S-MFTLanguage Model Backbone=LLaMA2-7B, Vision Tower=CLIP-ViT-Large2025.12 | 57.6 | — | — | |
| LoRALanguage Model Backbone=LLaMA2-7B, Vision Tower=CLIP-ViT-Large2025.12 | 56.5 | — | — | |
| DARTBackbone=Qwen2.5-VL-7B, Token Retention Rate=10%2025.12 | 48.31 | — | — | |
| CLIP-ScoreBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 39.7 | — | |
| CoIDOBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 43.2 | — | |
| COINCIDEBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 33 | — | |
| EL2NBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 42.4 | — | |
| Full-DataBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=100%2026.05 | — | 38.3 | — | |
| ICONSBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 49.9 | — | |
| IFDBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 42 | — | |
| OFABackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 55.7 | — | |
| PreSelBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 39.7 | — | |
| RandomBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 38.7 | — | |
| Self-FilterBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 42.6 | — | |
| TypiClustBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 37.7 | — | |
| XMASBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | — | 42.4 | — |