Multimodal Reasoning on MME
2,304Perception ScoreQwen2.5-VL-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7BToken Pruning Rate=0%2026.04 | 2,304 | |
| DeSAPToken Pruning Rate=66.7%2026.04 | 2,183 | |
| DeSAPToken Pruning Rate=77.8%2026.04 | 2,110 | |
| HoloVToken Pruning Rate=66.7%2026.04 | 2,093 | |
| FastVToken Pruning Rate=66.7%2026.04 | 2,072 | |
| DeSAPToken Pruning Rate=88.9%2026.04 | 2,056 | |
| HoloVToken Pruning Rate=77.8%2026.04 | 2,043 | |
| FastVToken Pruning Rate=77.8%2026.04 | 2,036 | |
| HoloVToken Pruning Rate=88.9%2026.04 | 2,006 | |
| FastVToken Pruning Rate=88.9%2026.04 | 1,940 | |
| Qwen2.5-VL-7BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 1,693.9 | |
| SpaceR-sft-7BFT-Data=151K, Fine-tuned on identical training data=false2026.03 | 1,688.1 | |
| ViLASR-7BFT-Data=73K, Fine-tuned on identical training data=false2026.03 | 1,634.4 | |
| InternVL3-2BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 1,610.2 | |
| Qwen2.5-VL-3BFT-Data=-, Fine-tuned on identical training data=false2026.03 | 1,526.1 | |
| Cambrain-S-3BFT-Data=10M, Fine-tuned on identical training data=false2026.03 | 1,490.8 | |
| GeoSenseFT-Data=940K, Fine-tuned on identical training data=false2026.03 | 1,473.7 | |
| VG-LLMFT-Data=385k, Fine-tuned on identical training data=false2026.03 | 1,441.6 | |
| SpatialLadder-3BFT-Data=26K, Fine-tuned on identical training data=false2026.03 | 1,403.2 | |
| Qwen2.5-VL-3B*FT-Data=940k, Fine-tuned on identical training data=true2026.03 | 1,301.2 | |
| VG-LLM*FT-Data=940k, Fine-tuned on identical training data=true2026.03 | 1,248.5 |