Video Understanding on Depth Target Domain
57.2Action UnderstandingFinetuning (Trainable VE, Frozen LLM)
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Finetuning (Trainable VE, Frozen LLM)Vision Encoder=trainable, LLM=frozen, Vision Language Connector=trainable2025.10 | 57.2 | 69.63 | 54.43 | 64.48 | 61.44 | 15.57 | |
| VISCOPVision Language Connector=trainable2025.10 | 56.78 | 73.17 | 66.23 | 64.35 | 65.13 | 19.27 | |
| Finetuning (Frozen VE, Frozen LLM)Vision Encoder=frozen, LLM=frozen, Vision Language Connector=trainable2025.10 | 55.67 | 66.59 | 62.46 | 64.49 | 62.3 | 16.44 | |
| Finetuning (Frozen VE, LoRA LLM)Vision Encoder=frozen, LLM=LoRA updates, Vision Language Connector=trainable2025.10 | 42.94 | 53.54 | 43.92 | 63.96 | 51.09 | 5.23 | |
| Base VLMVision Encoder=frozen, LLM=frozen2025.10 | 34.73 | 50.61 | 35.06 | 63.06 | 45.86 | — |