Multi-modal Reasoning and Understanding on MM-Vet
74.6AccuracyVL-Rethinker
Evaluation Results
| Method | Links | |
|---|---|---|
| VL-RethinkerData Size=39k2026.04 | 74.6 | |
| V-STARData Size=40k2026.04 | 74.1 | |
| VL-CogitoData Size=80k2026.04 | 73.2 | |
| R1-OnevisionData Size=155k2026.04 | 72.1 | |
| ThinkLite-VLData Size=11k2026.04 | 67.8 | |
| OpenVLThinkerData Size=59.2k2026.04 | 66.9 | |
| Qwen2.5VL2026.04 | 66 | |
| Vision-R1Data Size=210k2026.04 | 65.6 | |
| InstructBLIPLLM=Vicuna-7B, Eff. Res.=224, Vis. Tok.=32, Cxt. Len.=32, PT=129M, SFT=1.2M2024.06 | 53.4 | |
| LLaVA-NextLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=2880, PT=558K, SFT=765K2024.06 | 49.1 | |
| LLaVA-NextLLM=Vicuna-7B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=2880, PT=558K, SFT=765K2024.06 | 44.1 | |
| DeepStack-L-HDLLM=Vicuna-13B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 39.3 | |
| VILALLM=Llama2-13B, Eff. Res.=336, Vis. Tok.=576, Cxt. Len.=576, PT=50M, SFT=1M2024.06 | 38.8 | |
| DeepStack-L-HDLLM=Vicuna-7B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 37.5 | |
| DeepStack-LLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 35.9 | |
| LLaVA-1.5LLM=Vicuna-13B, Eff. Res.=336, Vis. Tok.=576, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 35.4 | |
| VILALLM=Llama2-7B, Eff. Res.=336, Vis. Tok.=576, Cxt. Len.=576, PT=50M, SFT=1M2024.06 | 34.9 | |
| DeepStack-VLLM=Vicuna-7B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 33 | |
| DeepStack-VLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 31.1 | |
| DeepStack-LLLM=Vicuna-7B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=576, PT=558K, SFT=665K2024.06 | 29.9 |