Highlight Detection on QVHighlights (test)
71.01HIT@1FlashVTG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FlashVTGBackbone=InternVideo22024.12 | 71.01 | 44.09 | — | |
| SG-DETREvaluation Protocol=Fine-tuned, Pre-trained=InterVid-MR2024.10 | 71 | 58.8 | — | |
| GPT-4oModel Category=General Vid-LLMs, Enhancement=NumPro2024.11 | 70.7 | 40.5 | — | |
| HL-CLIPconfiguration=HL-CLIP-2 (SP)2024.04 | 70.6 | 41.94 | — | |
| VIDEOLIGHTS-BPre-training=true2024.12 | 70.56 | — | 42.84 | |
| VIDEOLIGHTS-BPre-training=false2024.12 | 68.94 | — | 42.43 | |
| GPT-4oModel Category=General Vid-LLMs2024.11 | 68.7 | 39.5 | — | |
| SG-DETREvaluation Protocol=Zero-shot, Pre-trained=InterVid-MR2024.10 | 68 | 48.3 | — | |
| UVCOM + Oursbaseline=UVCOM2024.12 | 66.54 | 40.91 | — | |
| GranAlignSetting=ZS2026.01 | 66.34 | 39.35 | — | |
| UniVTGBackbone=CLIP-B/32, Post Pre-train=4.2M Corpus, #Params=41.3M2024.03 | 66.28 | — | 40.54 | |
| UniVTGPre-training=true2024.12 | 66.28 | — | 40.54 | |
| CG-DETR2024.12 | 66.21 | 40.33 | — | |
| CG-DETR2024.04 | 66.21 | 40.33 | — | |
| CG-DETRBackbone=SlowFast R-50, CLIP-B/32, PANN, Post Pre-train=No, #Params=9.0M2024.03 | 66.21 | — | 40.33 | |
| CG-DETRBackbone=SF+C2024.12 | 66.21 | 40.33 | — | |
| CG-DETR2026.03 | 66.21 | 40.33 | — | |
| CG-DETRFeatures=Slowfast + CLIP2023.11 | 66.2 | — | 40.3 | |
| FlashVTG2024.12 | 66.15 | 41.07 | — | |
| FlashVTGBackbone=SF+C2024.12 | 66.15 | 41.07 | — | |
| TR-DETR + Oursbaseline=TR-DETR2024.12 | 66.02 | 41.54 | — | |
| CVA2026.03 | 66.01 | 44.43 | — | |
| VIDEOLIGHTSPre-training=true2024.12 | 65.89 | — | 41.48 | |
| LLMEPETBackbone=SF+C2024.12 | 65.69 | 40.33 | — | |
| UVCOMASR Captions Pretrain=true2023.11 | 65.58 | 39.98 | — | |
| UVCOMPre-training=true2024.12 | 65.58 | — | 39.98 | |
| DiffusionVMRProposal spans=50, Sampling steps=52023.08 | 65.43 | 39.8 | — | |
| VIDEOLIGHTSPre-training=false2024.12 | 65.3 | — | 40.57 | |
| GranAlign†Setting=ZS, Components=detailed query with query-aware captioning only2026.01 | 64.98 | 37.41 | — | |
| UVCOMAudio Modality=true2023.11 | 64.79 | 39.79 | — | |
| QD-DETR + Oursbaseline=QD-DETR2024.12 | 64.46 | 40.35 | — | |
| R2-Tuning2024.12 | 64.2 | 39.18 | — | |
| UVCOM2024.12 | 64.2 | 39.74 | — | |
| UVCOM2023.11 | 64.2 | 39.74 | — | |
| R2-TuningBackbone=CLIP-B/16, PANN, Post Pre-train=No, #Params=2.7M2024.03 | 64.2 | — | 40.75 | |
| UVCOMPre-training=false2024.12 | 64.2 | — | 39.74 | |
| R2-TuningBackbone=CLIP2024.12 | 64.2 | 40.75 | — | |
| QD-DETRTraining Mode=Fine-tuned, Model Category=Expert model2024.10 | 64.2 | 38.9 | — | |
| UVCOM2026.03 | 64.2 | 39.74 | — | |
| TR-DETR2024.12 | 63.42 | 39.91 | — | |
| TR-DETRBackbone=SlowFast R-50, CLIP-B/32, PANN, Post Pre-train=No, #Params=12.0M2024.03 | 63.42 | — | 39.91 | |
| TR-DETR2024.12 | 63.42 | — | 39.91 | |
| TR-DETR2026.03 | 63.42 | 39.91 | — | |
| QD-DETRPre-training=false2024.12 | 63.1 | — | 39.13 | |
| QD-DETRSource Modality=V+A2023.03 | 62.87 | 39.04 | — | |
| QD-DETRAudio Modality=true2023.11 | 62.87 | 39.04 | — | |
| QD-DETRSetting=FS2026.01 | 62.87 | 39.04 | — | |
| Moment-GPTSetting=ZS2026.01 | 62.7 | 36.7 | — | |
| QD-DETRSource Modality=V2023.03 | 62.4 | 38.94 | — | |
| QD-DETRProposal spans=50, Sampling steps=52023.08 | 62.4 | 38.94 | — | |
| QD-DETR2024.04 | 62.4 | 38.94 | — | |
| QD-DETRBackbone=SlowFast R-50, CLIP-B/32, PANN, Post Pre-train=No, #Params=7.6M2024.03 | 62.4 | — | 38.94 | |
| QD-DETRBackbone=SF+C2024.12 | 62.4 | 38.94 | — | |
| QD-DETR2026.03 | 62.4 | 38.94 | — | |
| UMTpre-training (ASR captions)=true2022.03 | 62.39 | 39.12 | — | |
| UMTASR Captions Pretrain=true2023.11 | 62.39 | 39.12 | — | |
| UMTBackbone=CLIP-B/32, Post Pre-train=236K ASR Cap., #Params=14.9M2024.03 | 62.39 | — | 39.12 | |
| UMTPre-training=true2024.12 | 62.39 | — | 39.12 | |
| QD-DETRASR Captions Pretrain=true2023.11 | 62.27 | 38.52 | — | |
| QD-DETRPre-training=true2024.12 | 62.27 | — | 38.52 | |
| QD-DETR2024.12 | 62.13 | 39.01 | — | |
| CLIPDescription=clip-wise similarity scores2021.07 | 61.04 | 31.3 | — | |
| CLIPProposal spans=50, Sampling steps=52023.08 | 61.04 | 31.3 | — | |
| QD-DETRFeatures=Slowfast + CLIP2023.11 | 61 | — | 38.9 | |
| UniVTG2024.12 | 60.96 | 38.2 | — | |
| UniVTG2023.11 | 60.96 | 38.2 | — | |
| UniVTGProposal spans=50, Sampling steps=52023.08 | 60.96 | 38.2 | — | |
| UniVGT2024.04 | 60.96 | 38.2 | — | |
| UniVTGBackbone=SlowFast R-50, CLIP-B/32, PANN, Post Pre-train=No, #Params=41.3M2024.03 | 60.96 | — | 38.2 | |
| UniVTGPre-training=false2024.12 | 60.96 | — | 38.2 | |
| UniVTGBackbone=SF+C2024.12 | 60.96 | 38.2 | — | |
| UniVTG2026.03 | 60.96 | 38.2 | — | |
| MH-DETR2023.11 | 60.51 | 38.22 | — | |
| MH-DETRProposal spans=50, Sampling steps=52023.08 | 60.51 | 38.22 | — | |
| MH-DETRBackbone=SlowFast R-50, CLIP-B/32, PANN, Post Pre-train=No, #Params=8.2M2024.03 | 60.51 | — | 38.22 | |
| MH-DETRPre-training=false2024.12 | 60.51 | — | 38.22 | |
| Moment-DETRPre-training=weakly supervised with ASR captions2021.07 | 60.17 | 37.43 | — | |
| Moment-DETRpre-training (ASR captions)=true2022.03 | 60.17 | 37.43 | — | |
| M-DETRASR Captions Pretrain=true2023.11 | 60.17 | 37.43 | — | |
| Moment-DETRBackbone=CLIP-B/32, Post Pre-train=236K ASR Cap., #Params=4.8M2024.03 | 60.17 | — | 37.43 | |
| Moment-DETRPre-training=true2024.12 | 60.17 | — | 37.43 | |
| UMTFeatures=Slowfast + CLIP2023.11 | 60 | — | 38.2 | |
| UniVTGFeatures=Slowfast + CLIP2023.11 | 60 | — | 38.2 | |
| UMTadditional audio features=true2024.12 | 59.99 | 38.18 | — | |
| UMTpre-training (ASR captions)=false2022.03 | 59.99 | 38.18 | — | |
| UMTSource Modality=V+A2023.03 | 59.99 | 38.18 | — | |
| UMTAudio Modality=true2023.11 | 59.99 | 38.18 | — | |
| UMTProposal spans=50, Sampling steps=5, audio features=true2023.08 | 59.99 | 38.18 | — | |
| UMT2024.04 | 59.99 | 38.18 | — | |
| UMTBackbone=SlowFast R-50, CLIP-B/32, PANN, Post Pre-train=No, #Params=14.9M2024.03 | 59.99 | — | 38.18 | |
| UMTAudio modality=true, Pre-training=false2024.12 | 59.99 | — | 38.18 | |
| UMTBackbone=SF+C2024.12 | 59.99 | 38.18 | — | |
| UMT2026.03 | 59.99 | 38.18 | — | |
| TaskWeavetest from author provided checkpoint=true2024.12 | 59.08 | 37.87 | — | |
| EaTR2023.11 | 58.65 | 37.15 | — | |
| EaTR2024.12 | 58.65 | — | 37.15 | |
| EaTR2026.03 | 58.65 | 37.15 | — | |
| TempSamp-R1Base Model=Qwen2.5-VL, Size (B)=8.3, Trained Parameters (B)=8.3, Frames=752025.12 | 57.6 | 30 | — | |
| BLIP-3Base Model=BLIP-3, Size (B)=4.36, Trained Parameters (B)=0.14, Frames=252025.12 | 56.74 | 34.48 | — | |
| Moment-DETRSetting=FS2026.01 | 55.7 | 35.7 | — |