Egocentric Text Retrieval on Ego-Exo4D
55.1Overall Top-1 AccuracyQwen3-VL-emb-8B + DS2M
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3-VL-emb-8B + DS2MModel Type=Embedding Model, Fine-tuning Data=DS2M2026.04 | 55.1 | — | — | — | — | |
| Qwen3-VL-emb-8BModel Type=Embedding Model2026.04 | 54 | — | — | — | — | |
| Gemini-2.5-ProModality=video2025.11 | 48.7 | 53.9 | 29 | 67.4 | 50.9 | |
| CamFormer embeddings*Modality=video+trajectory, # MACs (G)=89.51, # Params (M)=151.02025.11 | 46 | 56 | 45.8 | 51.4 | 45.9 | |
| CamFormer embeddingsModality=trajectory, # MACs (G)=0.02, # Params (M)=0.32025.11 | 44.8 | 56.1 | 46.4 | 34.3 | 32.7 | |
| Qwen3-VL-8B + DS2MModel Type=Instruct Model, Fine-tuning Data=DS2M2026.04 | 40.9 | — | — | — | — | |
| EgoVLPv2 (Ego-Exo4D)Modality=video, # MACs (G)=89.49, # Params (M)=150.72025.11 | 38.4 | 39.1 | 25.6 | 50.5 | 45.4 | |
| Qwen3-VL-8BModel Type=Instruct Model2026.04 | 37.2 | — | — | — | — | |
| Qwen3-VL-8B + Ego4D + DS2MModel Type=Instruct Model, Fine-tuning Data=Ego4D + DS2M2026.04 | 37 | — | — | — | — | |
| InternVL3-8BModel Type=Comparison Model2026.04 | 36.8 | — | — | — | — | |
| Qwen3-VL-8B + Ego4DModel Type=Instruct Model, Fine-tuning Data=Ego4D2026.04 | 36.6 | — | — | — | — | |
| EgoVLPv2 (Ego4D)Modality=video, # MACs (G)=89.49, # Params (M)=150.72025.11 | 34.4 | 30.9 | 24.8 | 48.7 | 40.9 | |
| LLaVA-Video-7BModel Type=Comparison Model2026.04 | 33.9 | — | — | — | — | |
| CLAPModality=audio, # MACs (G)=6.80, # Params (M)=32.82025.11 | 24.6 | 21.4 | 20.1 | 29.5 | 33.3 | |
| PRIMUSModality=IMU, # MACs (G)=0.03, # Params (M)=1.42025.11 | 23.2 | 18.5 | 25.3 | 24.7 | 22 | |
| CLIPModality=image, # MACs (G)=2.95, # Params (M)=59.02025.11 | 22.9 | 25.2 | 18.2 | 26.8 | 21.9 |