Multimodal Understanding on COCO Caption (test)
58.3TextVQAZeroshot
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| ZeroshotBackbone=LLaVA-1.5-7B, Fine-tuned=No2026.02 | 58.3 | 58 | 65.1 | 64.6 | 58.2 | 62 | 40.3 | 50.7 | 48.5 | |
| GraftingBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 57.2 | 55.9 | 64.1 | 64.8 | 58.5 | 59.8 | 81.6 | 70.8 | 69.2 | |
| DowserBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 57 | 54.3 | 65 | 62.9 | 55 | 60.3 | 123.6 | 91.3 | 79.9 | |
| SPIDERBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 56.1 | 53.2 | 64.7 | 63.9 | 57.5 | 59.8 | 103.1 | 81.1 | 75.2 | |
| TailorBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 55 | 50.9 | 64.5 | 64.8 | 58.4 | 58.8 | 106.7 | 82.7 | 75.8 | |
| Full-FTBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 52.7 | 48.8 | 63 | 63.9 | 58 | 57.5 | 100 | 78.7 | 72.9 | |
| DAREBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 52.2 | 48.1 | 62.4 | 63.7 | 58.1 | 57.1 | 99.1 | 78 | 72.3 |