Gaze Following on VideoAttentionTarget (test)
0.938AUCViTGaze
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ViTGazeModality=single-modality, #Params.=22 M, GFLOPS (224x224)=4.622024.03 | 0.938 | 0.102 | 0.905 | — | |
| Gaze-LLEbackbone=ViT-L, without finetuning=true2024.12 | 0.937 | — | — | 0.1 | |
| GTRModality=multi-modality2024.03 | 0.936 | 0.095 | 0.927 | — | |
| Tonini et al.Modality=multi-modality, #Params.=54 M, GFLOPS (224x224)=5.782024.03 | 0.933 | 0.104 | 0.934 | — | |
| Gaze-LLEbackbone=ViT-B, without finetuning=true2024.12 | 0.932 | — | — | 0.105 | |
| Miao et al.without finetuning=true2024.12 | 0.923 | — | — | 0.109 | |
| Miao et al.Modality=multi-modality, #Params.=62 M, GFLOPS (224x224)=9.132024.03 | 0.917 | 0.109 | 0.908 | — | |
| GuptaModality=multi-modality, #Params.=61 M, GFLOPS (224x224)=5.322024.03 | 0.913 | 0.11 | 0.879 | — | |
| Tafasca et al.without finetuning=true2024.12 | 0.911 | — | — | 0.123 | |
| Gupta et al.without finetuning=true2024.12 | 0.907 | — | — | 0.137 | |
| Chong et al.without finetuning=true2024.12 | 0.906 | — | — | 0.119 | |
| DAMModality=multi-modality, #Params.=69 M, GFLOPS (224x224)=6.532024.03 | 0.905 | 0.108 | 0.896 | — | |
| HGTTRModality=single-modality, #Params.=43 M, GFLOPS (224x224)=4.892024.03 | 0.904 | 0.126 | 0.854 | — | |
| Jin et al.without finetuning=true2024.12 | 0.9 | — | — | 0.104 | |
| ESCNetModality=multi-modality2024.03 | 0.885 | 0.12 | 0.869 | — | |
| VSG-IAModality=multi-modality, #Params.=57 M, GFLOPS (224x224)=9.742024.03 | 0.88 | 0.118 | 0.881 | — | |
| Chong et al.Modality=multi-modality, #Params.=54 M, GFLOPS (224x224)=9.082024.03 | 0.86 | 0.134 | 0.853 | — | |
| Tonini et al.without finetuning=true, UDA=true2024.12 | 0.84 | — | — | 0.238 | |
| Lian et al.Modality=single-modality, #Params.=56 M, GFLOPS (224x224)=10.652024.03 | 0.837 | 0.165 | — | — | |
| Chong et al. (Single-modality)Modality=single-modality2024.03 | 0.83 | 0.193 | 0.705 | — |