Visual Question Answering on IconQA text-based multiple-choice downstream (test)
58.3TextVQA AccuracyZeroshot
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| ZeroshotBackbone=LLaVA-1.5-7B2026.02 | 58.3 | 58 | 65.1 | 64.6 | 58.2 | 62 | 25.3 | 43.1 | 35.7 | |
| Model GraftingBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 58.1 | 58.2 | 65.1 | 63.4 | 56.3 | 61.8 | 22.4 | 41.4 | 32.7 | |
| Model-DowserBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 57.7 | 58.5 | 65.3 | 63 | 53.9 | 61.8 | 44.9 | 52.4 | 51.3 | |
| SPIDERBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 54.8 | 55 | 61.2 | 61.7 | 52.1 | 60 | 44.8 | 51.1 | 50.4 | |
| ModelTailorBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 54.7 | 56.2 | 65.1 | 58.3 | 49.5 | 61.1 | 29.6 | 43.5 | 39.1 | |
| Full-FTBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 50.6 | 53.9 | 56.6 | 59.1 | 50.5 | 57.6 | 44.4 | 49.5 | 49 | |
| DAREBackbone=LLaVA-1.5-7B, Fine-tuning scope=last 20 layers of language decoder, Update ratio (ρ)=0.12026.02 | 50.4 | 53.8 | 56.2 | 59.1 | 50.5 | 57 | 44.5 | 49.5 | 49 |