Spatial Understanding on COCO-QA v1.5 (Spatial)
71.51COCO-QA_Spat AccuracyLLaVAflickr SiTe-ratio
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVAflickr SiTe-ratioTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-ratio, Pretraining Dataset=Flickr30K2025.12 | 71.51 | |
| LLaVAflickr SiTe-randTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-rand, Pretraining Dataset=Flickr30K2025.12 | 71.42 | |
| LLaVASiTe-ratioTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-ratio, Pretraining Dataset=558K2025.12 | 70.06 | |
| LLaVAflickr BaselineTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=Baseline, Pretraining Dataset=Flickr30K2025.12 | 68.96 | |
| LLaVA_1K_SiTe-randTraining Stage=Supervised Fine-tuning, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-rand, SFT Sample Count=1K2025.12 | 68.81 | |
| LLaVASiTe-randTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-rand, Pretraining Dataset=558K2025.12 | 68.75 | |
| LLaVA_5K_SiTe-ratioTraining Stage=Supervised Fine-tuning, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-ratio, SFT Sample Count=5K2025.12 | 68.37 | |
| LLaVARotateTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=Rotate, Pretraining Dataset=558K2025.12 | 68.09 | |
| LLaVAVSRTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=VSR, Pretraining Dataset=558K2025.12 | 67.85 | |
| LLaVACropTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=Crop, Pretraining Dataset=558K2025.12 | 67.82 | |
| LLaVABaselineTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=Baseline, Pretraining Dataset=558K2025.12 | 67.72 | |
| HALVASiTeTraining Stage=Supervised Fine-tuning, Backbone Architecture=HALVA, Data Augmentation Method=SiTe2025.12 | 64.77 | |
| Qwen2SiTe-randTraining Stage=Pretraining, Backbone Architecture=LLaVA-Qwen2-1.5B, Data Augmentation Method=SiTe-rand, Pretraining Dataset=558K2025.12 | 62.57 | |
| Qwen2SiTe-ratioTraining Stage=Pretraining, Backbone Architecture=LLaVA-Qwen2-1.5B, Data Augmentation Method=SiTe-ratio, Pretraining Dataset=558K2025.12 | 62.52 | |
| Qwen2BaselineTraining Stage=Pretraining, Backbone Architecture=LLaVA-Qwen2-1.5B, Data Augmentation Method=Baseline, Pretraining Dataset=558K2025.12 | 62.25 | |
| Qwen2flickr SiTe-ratioTraining Stage=Pretraining, Backbone Architecture=LLaVA-Qwen2-1.5B, Data Augmentation Method=SiTe-ratio, Pretraining Dataset=Flickr30K2025.12 | 49.04 | |
| Qwen2flickr SiTe-randTraining Stage=Pretraining, Backbone Architecture=LLaVA-Qwen2-1.5B, Data Augmentation Method=SiTe-rand, Pretraining Dataset=Flickr30K2025.12 | 47.71 |