Multimodal Adaptation on Flickr30k
52.15Flickr30k PerformanceFine-tuned Model
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Fine-tuned ModelBackbone=Qwen-2.5VL-3B2026.06 | 52.15 | 59.05 | 66.3 | |
| WandaBackbone=Qwen-2.5VL-3B2026.06 | 51.46 | 58.61 | 66.23 | |
| DAREBackbone=Qwen-2.5VL-3B2026.06 | 51.04 | 57.89 | 65.11 | |
| MagnitudeBackbone=Qwen-2.5VL-3B2026.06 | 50.85 | 58.13 | 65.95 | |
| CGM†Backbone=Qwen-2.5VL-3B2026.06 | 50.09 | 59.52 | 70.75 | |
| CGMBackbone=Qwen-2.5VL-3B2026.06 | 49.1 | 59.2 | 71.69 | |
| TailorBackbone=Qwen-2.5VL-3B2026.06 | 47.97 | 55.85 | 64.73 | |
| Pre-trained ModelBackbone=Qwen-2.5VL-3B2026.06 | 30.62 | 43.61 | 70.71 | |
| GraftingBackbone=Qwen-2.5VL-3B2026.06 | 29.11 | 40.63 | 63.01 |