Multimodal Benchmarking on MMBench-CN
92.39ScoreAuroraEdge-V-2B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AuroraEdge-V-2BNumber of parameters=2B2026.01 | 92.39 | — | — | |
| Qwen2.5-VL-3BNumber of parameters=3B2026.01 | 82.98 | — | — | |
| InternVL 2.5 8BFLOPs=12.575, Ratio(%)=100.0, Token budget=Full2026.03 | 82.6 | — | 100 | |
| ASAPFLOPs=3.969, Ratio(%)=31.56, Token budget=510 tokens2026.03 | 82.47 | — | 98.76 | |
| FastVFLOPs=3.969, Ratio(%)=31.56, Token budget=510 tokens2026.03 | 80.32 | — | 97.17 | |
| ASAPFLOPs=2.663, Ratio(%)=21.17, Token budget=340 tokens2026.03 | 80.15 | — | 95.69 | |
| LongVILA-7B (S3)LLM=Qwen2-7B, Resolution=dynamic2024.08 | 80 | — | — | |
| FastVFLOPs=2.663, Ratio(%)=21.17, Token budget=340 tokens2026.03 | 79.33 | — | 95.02 | |
| Baseline2026.02 | 78.52 | — | — | |
| VisionSelectorRetain Tokens=25%2026.02 | 74.74 | — | — | |
| InternVL-2.5-2BNumber of parameters=2B2026.01 | 74.29 | — | — | |
| Qwen2-VL-2BNumber of parameters=2B2026.01 | 74.24 | — | — | |
| IDPrunerRetain Tokens=25%2026.02 | 73.71 | — | — | |
| DivPruneRetain Tokens=25%2026.02 | 73.2 | — | — | |
| DARTRetain Tokens=25%2026.02 | 72.25 | — | — | |
| LLaVA-NeXT-8BLLM=Llama 3-8B, Resolution=6722024.08 | 72.1 | — | — | |
| FastVRetain Tokens=25%2026.02 | 70.36 | — | — | |
| SCOPERetain Tokens=25%2026.02 | 70.27 | — | — | |
| VisPrunerRetain Tokens=25%2026.02 | 69.93 | — | — | |
| IDPrunerRetain Tokens=10%2026.02 | 69.67 | — | — | |
| VisionSelectorRetain Tokens=10%2026.02 | 68.04 | — | — | |
| DivPruneRetain Tokens=10%2026.02 | 67.18 | — | — | |
| SCOPERetain Tokens=10%2026.02 | 66.07 | — | — | |
| VisionZipRetain Tokens=25%2026.02 | 65.89 | — | — | |
| INF-LLaVA*Source=Ours, larger_dataset=true2024.07 | 64.57 | — | — | |
| VILALLM=Llama 2-13B, Resolution=3362024.08 | 64.3 | — | — | |
| LLaVA-1.5LLM Training #P=13B, Input image resolution (Res.)=336, Pre-training samples (PT)=558K, Instruction tuning samples (IT)=665K2024.08 | 63.6 | — | — | |
| LLaVA-1.5LLM=Vicuna-1.5-13B, Resolution=3362024.08 | 63.6 | — | — | |
| LLaVA-1.5-13BFLOPs=3.817, Ratio=100%, Retained Tokens=Vanilla2026.03 | 63.6 | — | — | |
| HiPruneRetain Tokens=25%2026.02 | 63.57 | — | — | |
| ASAPFLOPs=1.253, Ratio=31.88, Retained Tokens=1922026.03 | 63.4 | — | — | |
| INF-LLaVASource=Ours2024.07 | 63.23 | — | — | |
| DARTRetain Tokens=10%2026.02 | 63.14 | — | — | |
| PruMerge+FLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 62.54 | — | — | |
| FastVRetain Tokens=10%2026.02 | 62.46 | — | — | |
| ASAPFLOPs=0.797, Ratio=20.901, Retained Tokens=1282026.03 | 62.46 | — | — | |
| VisPrunerRetain Tokens=10%2026.02 | 61.77 | — | — | |
| SparseVLMFLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 61.77 | — | — | |
| VILALLM=Llama 2-7B, Resolution=3362024.08 | 61.7 | — | — | |
| PruMerge+FLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 61.51 | — | — | |
| SparseVLMFLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 61.51 | — | — | |
| MoExtendLLM Training #P=3B, Input image resolution (Res.)=336, Pre-training samples (PT)=558K, Instruction tuning samples (IT)=665K2024.08 | 61.5 | — | — | |
| FastVFLOPs=1.259, Ratio=32.99, Retained Tokens=1922026.03 | 61.05 | — | — | |
| HyperLLaVALLM Training #P=7B, Input image resolution (Res.)=336, Pre-training samples (PT)=558K, Instruction tuning samples (IT)=665K2024.08 | 60.6 | — | — | |
| DivpruneFLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 60.43 | — | — | |
| FastVFLOPs=0.836, Ratio=21.898, Retained Tokens=1282026.03 | 60.37 | — | — | |
| PDrop+EEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 59.1 | 101.4 | — | |
| DivpruneFLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 59.02 | — | — | |
| FastV+EEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 58.7 | 100.7 | — | |
| VisionZip+EEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 58.6 | 100.5 | — | |
| SparseVLMLoc.=L1–L32, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 58.6 | — | — | |
| PDropEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 58.5 | 100.3 | — | |
| LLaVA1.5Source=CVPR’242024.07 | 58.3 | — | — | |
| LLaVA-1.5LLM Training #P=7B, Input image resolution (Res.)=336, Pre-training samples (PT)=558K, Instruction tuning samples (IT)=665K2024.08 | 58.3 | — | — | |
| LLaVA-1.5LLM=Vicuna-1.5-7B, Resolution=3362024.08 | 58.3 | — | — | |
| BaseBackbone=LLaVA-1.5-7B2026.03 | 58.3 | — | — | |
| FastVEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 58.3 | 100 | — | |
| VanillaRetained Tokens=576, Base Model=LLaVA-v1.5-7B2026.04 | 58.3 | 100 | — | |
| VisionZipRetain Tokens=10%2026.02 | 58.16 | — | — | |
| LLaVA-1.5-7BRetained Tokens=576, Reduction Ratio=0%2025.12 | 58.1 | — | — | |
| VanillaLoc.=-, Retained Tokens=576, Pruning Ratio=0%2026.03 | 58.1 | — | — | |
| HoloVLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 58 | — | — | |
| DART+VTWRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.7 | — | — | |
| DART+RandomRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.7 | — | — | |
| FastV+VTWRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.6 | — | — | |
| FastV+RandomRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.5 | — | — | |
| FastVEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 57.5 | 98.6 | — | |
| AutoSelectLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 57.5 | — | — | |
| TIVESource=arXiv’242024.07 | 57.4 | — | — | |
| FastVRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.4 | — | — | |
| VisionZipEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 57.4 | 98.5 | — | |
| AutoSelectLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 57.4 | — | — | |
| VisionZipLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 57.3 | — | — | |
| DARTLoc.=L2, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 57.3 | — | — | |
| DARTRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 57.3 | 95.4 | — | |
| VisPrunerRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 57.3 | 97.3 | — | |
| DivPrune+VTWRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.2 | — | — | |
| SparseVLMRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.1 | — | — | |
| DARTRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 57.1 | — | — | |
| DARTLoc.=L2, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 57.1 | — | — | |
| DivPrune+RandomRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 56.9 | — | — | |
| VisionZip+EEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 56.8 | 97.4 | — | |
| PDropLoc.=L8–L24, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 56.8 | — | — | |
| LearnPrunerRetained Tokens=128, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 56.8 | 98.5 | — | |
| Qwen-VL-7B-ChatLLM Training #P=7B, Input image resolution (Res.)=448, Pre-training samples (PT)=1.4B, Instruction tuning samples (IT)=50M2024.08 | 56.7 | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482024.08 | 56.7 | — | — | |
| VisionZipEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 56.7 | 97.3 | — | |
| VisionZipLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 56.7 | — | — | |
| VisionZipRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 56.7 | 96.3 | — | |
| PDropEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 56.6 | 97.1 | — | |
| PDropLoc.=L8–L24, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 56.6 | — | — | |
| AutoSelectLoc.=Pre, Retained Tokens=64, Pruning Ratio=88.9%2026.03 | 56.6 | — | — | |
| PDropRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 56.5 | — | — | |
| HoloVLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 56.5 | — | — | |
| DivPruneRetained Tokens=192, Reduction Ratio=66.7%2025.12 | 56.2 | — | — | |
| FastV+EEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 56.2 | 96.4 | — | |
| HiPruneRetain Tokens=10%2026.02 | 56.01 | — | — | |
| FastVLoc.=L2–L32, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 55.9 | — | — | |
| PDrop+EEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 55.8 | 95.7 | — | |
| LearnPrunerRetained Tokens=64, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 55.7 | 96.9 | — |