Video Captioning on MSR-VTT (val)
41.7CIDErMulticlips: Clip Sampling + Video-LLaVA + LLM
Evaluation Results
| Method | Links | |
|---|---|---|
| Multiclips: Clip Sampling + Video-LLaVA + LLMSampling Strategy=Clip Sampling, LMM=Video-LLaVA, LLM=Vicuna-v1.5, Fusion=Late fusion2026.01 | 41.7 | |
| Katna + LLaVA + LLMSampling Strategy=Katna key frame sampling, LMM=LLaVA-1.5, LLM=Vicuna-v1.5, Fusion=Late fusion2026.01 | 36.8 | |
| Regular Sampling + LLaVA + LLMSampling Strategy=Regular Sampling, LMM=LLaVA-1.5, LLM=Vicuna-v1.5, Fusion=Late fusion2026.01 | 36.5 | |
| Random Sampling + LLaVA + LLMSampling Strategy=Random Sampling, LMM=LLaVA-1.5, LLM=Vicuna-v1.5, Fusion=Late fusion2026.01 | 35.1 | |
| Video-LLaVAArchitecture=Early fusion2026.01 | 28.6 |