General Vision-Language on VQA v2
82.6VQA v2 Accuracy1.7B K^4_{1.0}
Evaluation Results
| Method | Links | |
|---|---|---|
| 1.7B K^4_{1.0}Size=18B-A3B, Sparsity Configuration=K=4, alpha=1.02026.01 | 82.6 | |
| 1.7B K^8_{0.5}Size=18B-A3B, Sparsity Configuration=K=8, alpha=0.52026.01 | 82.4 | |
| Isaac 0.2Size=2B2026.01 | 80.8 | |
| LLaVASiTe-randTraining Stage=Pretraining, Backbone Architecture=LLaVA-v1.5-7B, Data Augmentation Method=SiTe-rand, Pretraining Dataset=558K2025.12 | 60.53 | |
| CoM-PTBackbone=ViT-L/16, PT Method=CoM-PT, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 56.07 | |
| BaselineBackbone=ViT-L/16, PT Method=Baseline, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 55.68 | |
| Qwen2_1K_SiTe-ratioTraining Stage=Supervised Fine-tuning, Backbone Architecture=LLaVA-Qwen2-1.5B, Data Augmentation Method=SiTe-ratio, SFT Sample Count=1K2025.12 | 55.3 | |
| CoM-PTBackbone=ViT-B/16, PT Method=CoM-PT, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 54.59 | |
| BaselineBackbone=ViT-B/16, PT Method=Baseline, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 54.16 |