Few-shot Visual Question Answering on VL-ICL Bench TextOCR (test)
26.4Mean AccuracyMAPD
Evaluation Results
| Method | Links | |
|---|---|---|
| MAPDTTA (Test-Time Adaptation) method=FT (K ≤ 30), MT (Meta-Tasks used during training)=Yes2025.06 | 26.4 | |
| LoRA ([0-15] LLM layers + ATT)TTA (Test-Time Adaptation) method=FT (K ≤ 30)2025.06 | 24.5 | |
| In-ContextPDTTA (Test-Time Adaptation) method=ICL, MT (Meta-Tasks used during training)=Yes2025.06 | 23.8 | |
| LoRA ([0-15] LLM layers)TTA (Test-Time Adaptation) method=FT (K ≤ 30)2025.06 | 23.8 | |
| Multi-TaskPDTTA (Test-Time Adaptation) method=FT (K ≤ 30), MT (Meta-Tasks used during training)=Yes2025.06 | 22.9 | |
| NoMeta-taskPDTTA (Test-Time Adaptation) method=FT (K ≤ 30), MT (Meta-Tasks used during training)=No2025.06 | 22.5 | |
| Model-AvgPDTTA (Test-Time Adaptation) method=FT (K ≤ 30), MT (Meta-Tasks used during training)=No2025.06 | 21.5 | |
| In-ContextPDTTA (Test-Time Adaptation) method=FT (K ≤ 30), MT (Meta-Tasks used during training)=Yes2025.06 | 18.9 | |
| LoRA (All LLM layers)TTA (Test-Time Adaptation) method=FT (K ≤ 30)2025.06 | 10.4 | |
| MAPDTTA (Test-Time Adaptation) method=ICL, MT (Meta-Tasks used during training)=Yes2025.06 | 7.3 | |
| Multi-TaskPDTTA (Test-Time Adaptation) method=ICL, MT (Meta-Tasks used during training)=Yes2025.06 | 6.9 | |
| NoMeta-taskPDTTA (Test-Time Adaptation) method=ICL, MT (Meta-Tasks used during training)=No2025.06 | 6.8 | |
| Model-AvgPDTTA (Test-Time Adaptation) method=ICL, MT (Meta-Tasks used during training)=No2025.06 | 2.8 |