Multimodal Understanding on ImageNet-R (test)
58.3TextVQAZeroshot
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| ZeroshotBackbone=LLaVA-1.5-7B, Fine-tuned=No2026.02 | 58.3 | 58 | 65.1 | 64.6 | 58.2 | 62 | 16.3 | 38.7 | 25.8 | |
| GraftingBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 57.7 | 55.8 | 65.7 | 64.6 | 58.8 | 61.4 | 67.3 | 64 | 63.8 | |
| DowserBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 54.6 | 48.4 | 64.8 | 64.4 | 55.8 | 56.5 | 88.8 | 73.1 | 69.7 | |
| SPIDERBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 46.8 | 27.4 | 55.6 | 63 | 54.8 | 43 | 89.3 | 68.9 | 62.8 | |
| TailorBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 38.1 | 18.2 | 40.1 | 61.4 | 54.8 | 36.8 | 84.3 | 62.9 | 55.7 | |
| Full-FTBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 24.3 | 10.2 | 26.2 | 48.6 | 45 | 20.6 | 89.7 | 59.4 | 44 | |
| DAREBackbone=LLaVA-1.5-7B, Fine-tuned layers=Last 20, Update ratio (rho)=0.12026.02 | 23.8 | 9.9 | 25.6 | 47.3 | 44.8 | 16.7 | 89.8 | 58.9 | 42.7 |