Spatial Understanding on MM-Vet Spatial
28.68MM-Vet SpatialLLaVASiTe-ratio
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVASiTe-ratioTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-ratio, Pretraining Dataset=558K2025.12 | 28.68 | |
| Qwen2_5K_SiTe-ratioTraining Stage=Supervised Fine-tuning, Backbone Architecture=LLaVA-Qwen2-1.5B, Data Augmentation Method=SiTe-ratio, SFT Sample Count=5K2025.12 | 25.1 |