Vision-Language Task on TextVQA (Accuracy Only)
43.83AccuracyCoM-PT
Evaluation Results
| Method | Links | |
|---|---|---|
| CoM-PTBackbone=ViT-L/16, PT Method=CoM-PT, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 43.83 | |
| BaselineBackbone=ViT-L/16, PT Method=Baseline, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 43.64 | |
| CoM-PTBackbone=ViT-B/16, PT Method=CoM-PT, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 43.21 | |
| BaselineBackbone=ViT-B/16, PT Method=Baseline, Fine-tuning Protocol=LoRA-based LLaVA-1.5-7B [41]2026.04 | 43.08 |