Image Classification on VLCS (4 Metrics)
84.2Accuracy (Metric 1)MVT + FT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MVT + FTMLLM=MMICL, Backbone=ViT-L2025.12 | 84.2 | 89.8 | 87.9 | 82.5 | — | |
| MVT + FTBackbone=ViT-L/142025.12 | 84.2 | 89.8 | 87.9 | 82.5 | — | |
| MVTMLLM=MMICL, Backbone=ViT-L2025.12 | 83.8 | 89 | 87.2 | 80.3 | — | |
| MVTBackbone=ViT-L/142025.12 | 83.8 | 89 | 87.2 | 80.3 | — | |
| MVT + FTBackbone=ViT-g2025.12 | 83.7 | 89.5 | 86.9 | 82 | — | |
| MVTBackbone=ViT-g2025.12 | 81.2 | 86.6 | 86.1 | 79.5 | — | |
| Vanilla FTBackbone=ViT-L/142025.12 | 78.8 | 85.2 | 83.4 | 77 | — | |
| MVT + FTMLLM=Otter, Backbone=ViT-L2025.12 | 76.8 | 87.7 | 82.3 | 77.4 | — | |
| Vanilla FTBackbone=ViT-g2025.12 | 75.5 | 82.3 | 82.1 | 75.6 | — | |
| CLIPMLLM=None, Backbone=ViT-L2025.12 | 74.9 | 83.5 | 80.3 | 74.5 | — | |
| CLIPBackbone=ViT-L/142025.12 | 74.9 | 83.5 | 80.3 | 74.5 | — | |
| EVABackbone=ViT-g2025.12 | 72.5 | 80 | 79.8 | 72.8 | — | |
| MVTMLLM=Otter, Backbone=ViT-L2025.12 | 67.5 | 77.4 | 73.7 | 66.6 | — |