Cultural Multimodal Understanding on CCBench
27.9ScoreSPHINX-1k
Evaluation Results
| Method | Links | |
|---|---|---|
| SPHINX-1kResolution=1k2023.11 | 27.9 | |
| SPHINX-2kResolution=2k2023.11 | 27.4 | |
| LLaVA1.5-13BModel Size=13B2023.11 | 26.5 | |
| SPHINX2023.11 | 25.6 | |
| LLaVA1.5-7BModel Size=7B2023.11 | 16.4 | |
| Qwen2.5-VL2026.01 | 0.592 | |
| LLaVA-OneVision2026.01 | 0.549 | |
| Gemma3-4b-it2026.01 | 0.369 | |
| Molmo2026.01 | 0.367 | |
| PaliGemma2026.01 | 0.333 | |
| LLaVA-NeXT2026.01 | 0.243 | |
| SmolVLM22026.01 | 0.231 | |
| LLaVA-AIMv2-2D-RoPEEncoder=AIMv2, 2D-RoPE=true2026.01 | 0.114 | |
| LLaVA-2D-RoPE2D-RoPE=true2026.01 | 0.086 | |
| LLaVA-SigLIP2Encoder=SigLIP22026.01 | 0.086 | |
| LLaVA-SigLIP2-2D-RoPEEncoder=SigLIP2, 2D-RoPE=true2026.01 | 0.086 | |
| LLaVA-AIMv2Encoder=AIMv22026.01 | 0.086 | |
| LLaVA-1.52026.01 | 0.084 | |
| LLaVA-SigLIP-2D-RoPEEncoder=SigLIP, 2D-RoPE=true2026.01 | 0.08 | |
| LLaVA-SigLIPEncoder=SigLIP2026.01 | 0.071 |