Multimodal Understanding on ScienceQA, TextVQA, GQA, VizWiz, and ImageNet
33.47AccuracyMoDE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MoDEBackbone=Chameleon [3], Evaluation Mode=Continual Tuning2025.12 | 33.47 | 25.99 | 22.78 | |
| MoELoRABackbone=Chameleon [3], Evaluation Mode=Continual Tuning2025.12 | 33.01 | 30.77 | 24.31 | |
| CL-MoEBackbone=Chameleon [3], Evaluation Mode=Continual Tuning2025.12 | 32.86 | 30.95 | 24.46 | |
| Model tailorBackbone=Chameleon [3], Evaluation Mode=Continual Tuning2025.12 | 32.62 | 27.66 | 24.7 | |
| DualPromptBackbone=Chameleon [3], Evaluation Mode=Continual Tuning2025.12 | 31.92 | 6.82 | 25.4 | |
| Seq LoRABackbone=Chameleon [3], Evaluation Mode=Continual Tuning2025.12 | 28.43 | 35.33 | 28.57 | |
| Zero-shotBackbone=Chameleon [3], Evaluation Mode=Zero-shot2025.12 | 22.48 | — | 34.84 |