Multimodal Reasoning on MMBench (English and Chinese Scores)
84.29MMBench Accuracy (en)Qwen3VL-2B-SFT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3VL-2B-SFTTokens=-2026.05 | 84.29 | 81.52 | — | |
| ETCTokens=42026.05 | 82.75 | 81.44 | — | |
| ETCTokens=22026.05 | 82.72 | 80.49 | — | |
| VoCoTokens=42026.05 | 82.56 | 79.63 | — | |
| ETCTokens=12026.05 | 82.4 | 80.39 | — | |
| VoCoTokens=22026.05 | 82.01 | 79.83 | — | |
| VoCoTokens=12026.05 | 81.34 | 78.91 | — | |
| ERABackbone=LLaVA-NeXT-13B, Tokens Retained=1602026.06 | 67.5 | 61.2 | — | |
| FullTraining Data Percentage=100%, Data Selection Constraint=None (Oracle)2026.04 | 66.1 | 58.9 | — | |
| LLaVA-1.5-7BReq. Inst.=100%, Sel. Inst.=665K2025.03 | 66 | 58.9 | 100 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=1602026.06 | 65.9 | 60.1 | — | |
| D2-PruningTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 65.7 | 57.6 | — | |
| PreSelReq. Inst.=15%, Sel. Inst.=93K2025.03 | 64.8 | 56.5 | 97.9 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Tokens Retained=5762026.06 | 64.7 | 58.1 | — | |
| VanillaToken Budget (Retained Tokens)=576, Reduction Ratio (↓ %)=0%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 64.6 | 58.1 | 100 | |
| TypiClustReq. Inst.=15%, Sel. Inst.=93K2025.03 | 64.3 | 57.1 | 96.8 | |
| SPprunerToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 63.8 | 57.6 | 99.4 | |
| DARTToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 63.7 | 57.3 | 99 | |
| SPprunerToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 63.4 | 57 | 98.5 | |
| COINCIDETraining Data Percentage=20%, Data Selection Constraint=Full Data Used before Selection2026.04 | 63.1 | 54.5 | — | |
| ICONSTraining Data Percentage=20%, Data Selection Constraint=Full Data Used before Selection2026.04 | 63.1 | 55.8 | — | |
| PyramidDropToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 63.1 | 57.1 | 98.7 | |
| DARTToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 63.1 | 57.3 | 97.2 | |
| PACTToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 63 | 56.4 | 98.1 | |
| VisionZipToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 62.9 | 57.4 | 99 | |
| DOSETraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 62.5 | 54.8 | — | |
| DivPruneToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 62.3 | 56.3 | 98.8 | |
| PyramidDropToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 62.3 | 56.6 | 96.5 | |
| RandomTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 62.2 | 54.8 | — | |
| PACTToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 62.2 | 54.3 | 96.9 | |
| VisionZipToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 62 | 56.7 | 97.6 | |
| SPprunerToken Budget (Retained Tokens)=64, Reduction Ratio (↓ %)=88.9%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 62 | 54.6 | 95.2 | |
| Self-SupTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 61.4 | 53.8 | — | |
| DARTToken Budget (Retained Tokens)=64, Reduction Ratio (↓ %)=88.9%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 61.4 | 53.9 | 93.4 | |
| DivPruneToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 61.3 | 54.9 | 97.4 | |
| FastVToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 61.2 | 57 | 90 | |
| RandomReq. Inst.=15%, Sel. Inst.=93K2025.03 | 61 | 53.5 | 95.7 | |
| ERABackbone=LLaVA-1.5-7B, Tokens Retained=322026.06 | 60.9 | 52.1 | — | |
| Qwen-VL-ChatReq. Inst.=100%, Sel. Inst.=50M2025.03 | 60.6 | 56.7 | — | |
| COINCIDEReq. Inst.=100%, Sel. Inst.=93K2025.03 | 60.5 | 53.9 | 95.5 | |
| PACTToken Budget (Retained Tokens)=64, Reduction Ratio (↓ %)=88.9%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 60.1 | 52.1 | 94 | |
| DivPruneToken Budget (Retained Tokens)=64, Reduction Ratio (↓ %)=88.9%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 60 | 52.5 | 94.4 | |
| ShikraReq. Inst.=100%, Sel. Inst.=5.5M2025.03 | 58.8 | — | — | |
| EL2NReq. Inst.=100%, Sel. Inst.=93K2025.03 | 58.2 | 48.5 | 93 | |
| PyramidDropToken Budget (Retained Tokens)=64, Reduction Ratio (↓ %)=88.9%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 57.9 | 49.5 | 88.6 | |
| IFDReq. Inst.=100%, Sel. Inst.=93K2025.03 | 57.2 | 50.6 | 91.8 | |
| FastVToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 56.1 | 56.4 | 82.9 | |
| CLIP-ScoreTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 55.2 | 52 | — | |
| VisionZipToken Budget (Retained Tokens)=64, Reduction Ratio (↓ %)=88.9%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 55.1 | 45.9 | 90.4 | |
| PerplexityReq. Inst.=100%, Sel. Inst.=93K2025.03 | 54.7 | 47.8 | 91.9 | |
| IDEFICS-80BReq. Inst.=100%, Sel. Inst.=1M2025.03 | 54.5 | 38.1 | — | |
| EL2NTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 53.2 | 47.4 | — | |
| SemDeDupTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 52.2 | 48.5 | — | |
| PerplexityTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 52 | 45.8 | — | |
| CLIP-ScoreReq. Inst.=100%, Sel. Inst.=93K2025.03 | 51 | 48 | 90.3 | |
| Self-FilterTraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 48.8 | 45.3 | — | |
| Self-FilterReq. Inst.=100%, Sel. Inst.=93K2025.03 | 48.1 | 45.4 | 88.8 | |
| FastVToken Budget (Retained Tokens)=64, Reduction Ratio (↓ %)=88.9%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 48 | 52.7 | 74 | |
| InstructBLIP-7BReq. Inst.=100%, Sel. Inst.=1.2M2025.03 | 36 | 23.7 | — | |
| Qwen3VL-2B-SFTTokens=02026.05 | 35.74 | 35.09 | — | |
| InstructionGPT-4Req. Inst.=100%, Sel. Inst.=0.2K2025.03 | 31.4 | — | — | |
| LLaMA-VIDTokens=42026.05 | 28.83 | 25.92 | — | |
| LLaMA-VIDTokens=22026.05 | 27.95 | 27.95 | — | |
| QueCCTokens=42026.05 | 25.8 | 25.29 | — | |
| QueCCTokens=12026.05 | 25.69 | 24.95 | — |