Vision-Language Perception and Reasoning on MMBench lite
84.8AccuracySECOND
Evaluation Results
| Method | Links | |
|---|---|---|
| SECONDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✓2025.06 | 84.8 | |
| SECONDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✗2025.06 | 82.6 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✓2025.06 | 80 | |
| VCDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✓2025.06 | 79.5 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✗2025.06 | 78 | |
| baselineModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=✗2025.06 | 77.3 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✗2025.06 | 75.8 | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=✓2025.06 | 74.2 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✗2025.06 | 74.2 | |
| baselineModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✗2025.06 | 73.5 | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✓2025.06 | 73.5 | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✗2025.06 | 72.7 | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✓2025.06 | 71.2 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✗2025.06 | 71.2 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=✓2025.06 | 70.5 | |
| VCDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=✓2025.06 | 70.5 |