Video Question Answering on Exocentric Source NeXTQA VideoMME ADL-X
84.32NeXTQA AccuracyBase VLM
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Base VLM2025.10 | 84.32 | 65.37 | 77.36 | 70.65 | 74.42 | — | |
| VISCOP2025.10 | 84.31 | 64.7 | 78.97 | 76.78 | 76.19 | 1.77 | |
| LLM-LoRA + Connector FinetuningVE Adaptation Strategy=Frozen, LLM Adaptation Strategy=LoRA, Vision Language Connector Finetuning=Trainable2025.10 | 84.24 | 64.41 | 77.42 | 74.36 | 75.11 | 0.68 | |
| Connector FinetuningVE Adaptation Strategy=Frozen, LLM Adaptation Strategy=Frozen, Vision Language Connector Finetuning=Trainable2025.10 | 84.21 | 62.67 | 76.56 | 75.51 | 74.74 | 0.31 | |
| VE + Connector FinetuningVE Adaptation Strategy=Trainable, LLM Adaptation Strategy=Frozen, Vision Language Connector Finetuning=Trainable2025.10 | 83.87 | 61.41 | 77.05 | 76.09 | 74.61 | 0.18 | |
| Full FinetuningVE Adaptation Strategy=Trainable, LLM Adaptation Strategy=Trainable, Vision Language Connector Finetuning=Trainable2025.10 | 82.34 | 64.26 | 78.21 | 70.89 | 73.93 | -0.5 |