Multimodal Evaluation on MME
2,565.72ScoreJigsaw + CARE
Evaluation Results
| Method | Links | |||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Jigsaw + CARETraining Environment=Jigsaw puzzles, CARE=true, Backbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,565.72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mix + CL + CARETraining Environment=Mixed (Jigsaw, PatchFit, Rotation), Curriculum Learning=true, CARE=true, Backbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,556.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jigsaw + CL + CARETraining Environment=Jigsaw puzzles, Curriculum Learning=true, CARE=true, Backbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,554.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JigsawTraining Environment=Jigsaw puzzles, Backbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,524.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPO-CAREBackbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,516.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisualSphinxBackbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,494.79 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaToken Reduction Ratio=Full Tokens (100%), Model=Qwen2-VL-72B, Quantization=4-bit2026.06 | 2,476 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AVISCheckpoint=Vision-R1 [5], Pruning rate (ρ)=Adaptive, Rollouts (K)=Adaptive2026.06 | 2,469 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 43 | |
| AVISCheckpoint=VL-Rethinker [18], Pruning rate (ρ)=Adaptive, Rollouts (K)=Adaptive2026.06 | 2,463 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 46 | |
| Vision-ZeroBackbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,458.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5 VLBackbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,442.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AVISCheckpoint=OpenVLThinker [75], Pruning rate (ρ)=Adaptive, Rollouts (K)=Adaptive2026.06 | 2,437 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 39 | |
| FixedCheckpoint=Vision-R1 [5], Pruning rate (ρ)=75%, Rollouts (K)=52026.06 | 2,436 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 63 | |
| FixedCheckpoint=OpenVLThinker [75], Pruning rate (ρ)=75%, Rollouts (K)=52026.06 | 2,435 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 55 | |
| InternVL3-8BModel Size=8B2026.02 | 2,410 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineCheckpoint=Vision-R1 [5], Pruning rate (ρ)=0%, Rollouts (K)=12026.06 | 2,408 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 100 | |
| EMOVAModel Size=72B2024.09 | 2,402 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FixedCheckpoint=VL-Rethinker [18], Pruning rate (ρ)=75%, Rollouts (K)=52026.06 | 2,402 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 61 | |
| Jigsaw + CL + CAREModel Size=7B, Training Strategy=Puzzle Curriculum GRPO + CL + CARE2025.12 | 2,393.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jigsaw + CAREModel Size=7B, Training Strategy=Puzzle Curriculum GRPO + CARE2025.12 | 2,389.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Visual JigsawBackbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,385.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaAverage Token Reduction=0.0%, Backbone=Qwen3-VL-8B2026.06 | 2,374 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FixedCheckpoint=Qwen 2.5 VL [1], Pruning rate (ρ)=75%, Rollouts (K)=52026.06 | 2,373 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 58 | |
| AVISCheckpoint=Qwen 2.5 VL [1], Pruning rate (ρ)=Adaptive, Rollouts (K)=Adaptive2026.06 | 2,364 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 42 | |
| Mix + CL + CAREModel Size=7B, Training Strategy=Mixed Tasks + CL + CARE2025.12 | 2,358.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Rotation + CL + CAREModel Size=7B, Training Strategy=Rotation + CL + CARE2025.12 | 2,357.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPO-CAREModel Size=7B, Training Strategy=Baseline2025.12 | 2,351.53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=InternVL-2.5-8B, Token Retention Rate=100%2025.12 | 2,349 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-V2.6-8BParameters=8B2024.12 | 2,348 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VLToken Ratio=Full Tokens2026.06 | 2,346 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViCritBackbone=Qwen 2.5 VL 7B, Evaluation Mode=thinking mode (think-answer)2025.12 | 2,341.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLSEToken Reduction Ratio=↓ 66.7%, Model=Qwen2-VL-72B, Quantization=4-bit2026.06 | 2,340 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JigsawModel Size=7B, Training Strategy=Puzzle Curriculum GRPO2025.12 | 2,339.72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLsI-7BParameters=7B2024.12 | 2,338 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PriorTRToken Ratio=33.3%2026.06 | 2,333 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=InternVL-2.5-8B, Token Reduction Ratio=0%2026.06 | 2,332 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=0%2026.04 | 2,330 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineCheckpoint=VL-Rethinker [18], Pruning rate (ρ)=0%, Rollouts (K)=12026.06 | 2,328 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 100 | |
| Qwen2-VL-7BParameters=7B2024.12 | 2,327 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen-2.5-VL-7B, Token Retention Rate=100%2026.02 | 2,327 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%, FFT Type=Global2026.06 | 2,325 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5-8BBase Model=InternVL2.5-8B, Token Reduction Ratio=0%2026.04 | 2,324 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineBackbone=Qwen2-VL 7B, Token Retention Ratio=100%2026.05 | 2,318 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMOVAModel Size=7B2024.09 | 2,317 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| D²PrunerBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 2,316 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PatchFit + CL + CAREModel Size=7B, Training Strategy=PatchFit + CL + CARE2025.12 | 2,315.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jigsaw + CLModel Size=7B, Training Strategy=Puzzle Curriculum GRPO + Curriculum Learning2025.12 | 2,315.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVToken Reduction Ratio=↓ 66.7%, Model=Qwen2-VL-72B, Quantization=4-bit2026.06 | 2,314 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%, FFT Type=Local2026.06 | 2,312 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VITAModel Size=1.52024.09 | 2,311 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2024.09 | 2,310 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLSEToken Reduction Ratio=↓ 77.8%, Model=Qwen2-VL-72B, Quantization=4-bit2026.06 | 2,309 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TroL-7BParameters=7B2024.12 | 2,308 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TroL-7BParameters=7B2024.06 | 2,308 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7BModel Size=7B2026.02 | 2,307 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwenVL2.5-7BModel Size=7B2026.02 | 2,306 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen2-VL-7B, Token Retention Ratio=100.0%2026.06 | 2,302 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisualSphinxModel Size=7B, Training Strategy=Baseline2025.12 | 2,296.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%, FFT Type=Global2026.06 | 2,293 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineCheckpoint=OpenVLThinker [75], Pruning rate (ρ)=0%, Rollouts (K)=12026.06 | 2,291 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 100 | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%, FFT Type=Local2026.06 | 2,291 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RoboInter-Qwen-7BModel Size=7B, Backbone=Qwen2026.02 | 2,281 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PDropToken Reduction Ratio=↓ 66.7%, Model=Qwen2-VL-72B, Quantization=4-bit2026.06 | 2,273 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipSpeedup=1.3x, Token Budget=Avg 640 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 2,267 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-2.5-VL-7BSpeedup=1.00×, Token Budget=Dynamic Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 2,264 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DUET-VLM (C)Speedup=1.3x, Token Budget=Avg 640 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 2,264 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaselineCheckpoint=Qwen 2.5 VL [1], Pruning rate (ρ)=0%, Rollouts (K)=12026.06 | 2,263 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 100 | |
| DUET-VLM (C)Speedup=1.4x, Token Budget=Avg 320 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 2,259 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBase Model=InternVL2.5-8B, Token Reduction Ratio=77.8%2026.04 | 2,253 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARTBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 2,252 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%2026.06 | 2,252 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 2,251 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipSpeedup=1.4x, Token Budget=Avg 320 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 2,251 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BRatio=100%, Backbone=Qwen2.5-VL-7B2026.05 | 2,251 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vision-ZeroModel Size=7B, Training Strategy=Baseline2025.12 | 2,247.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Visual JigsawModel Size=7B, Training Strategy=Baseline2025.12 | 2,243.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen 2.5 VLModel Size=7B, Training Strategy=Baseline2025.12 | 2,242.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen2.5-VL-7B, Token Retention Rate=100%2025.12 | 2,240 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DUET-VLM (C)Speedup=1.5x, Token Budget=Avg 160 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 2,235 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisPrunerToken Ratio=33.3%2026.06 | 2,224 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3Number of Parameters=2.1B2025.12 | 2,221.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARTBase Model=InternVL2.5-8B, Token Reduction Ratio=77.8%2026.04 | 2,220 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RoboInter-LLaVAOV-7BModel Size=7B, Backbone=LLaVA-OV2026.02 | 2,217 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ID-SelectionBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=77.8%, Importance Source=LLM second-layer cross-modal attention2026.04 | 2,217 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| F3ARatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 2,213.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2-8BParameters=8B2024.12 | 2,210 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipSpeedup=1.5x, Token Budget=Avg 160 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 2,210 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PriorTRToken Ratio=22.2%2026.06 | 2,208 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%2026.06 | 2,208 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=88.9%, FFT Type=Global2026.06 | 2,204 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipRatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 2,201.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=88.9%, FFT Type=Local2026.06 | 2,201 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| D²PrunerBackbone=InternVL-2.5-8B, Token Retention Rate=10%2025.12 | 2,196 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARTBase Model=Qwen2.5-VL-7B, Token Reduction Ratio=77.8%2026.04 | 2,193 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| D²PrunerBackbone=Qwen2.5-VL-7B, Token Retention Rate=25%2025.12 | 2,190 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVToken Ratio=33.3%2026.06 | 2,190 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DivPruneBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 2,189 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ID-SelectionBase Model=InternVL2.5-8B, Token Reduction Ratio=77.8%, Importance Source=LLM second-layer cross-modal attention2026.04 | 2,189 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Baichuan-OmniModel Size=7B2024.09 | 2,187 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-2BModel Size=2B2026.02 | 2,186 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |