Gaze target estimation on VideoAttentionTarget
0.051L2 DistanceOne Human
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| One Human2024.12 | 0.051 | 0.921 | 0.925 | — | |
| Human ExpertLearnable Params=-2026.03 | 0.051 | 0.921 | 0.925 | — | |
| PaGEGround Truth Gaze Matching=false2026.07 | 0.064 | 0.972 | 0.951 | — | |
| FGI-GazeParams=35M*2026.06 | 0.091 | 0.958 | 0.911 | — | |
| GTRParams=48.2M*2026.06 | 0.093 | 0.925 | 0.923 | — | |
| Tu et al. (2023)Ground Truth Gaze Matching=true2026.07 | 0.093 | 0.925 | 0.923 | — | |
| multi-scale object-aware frameworkParams=7.1M2026.06 | 0.095 | 0.948 | 0.923 | — | |
| GazeMoELearnable Params=3.4M2026.03 | 0.097 | 0.939 | 0.917 | — | |
| GazeVLM2025.11 | 0.102 | 0.948 | 0.898 | 25 | |
| Gaze-LLE (ViT-L)Learnable Params=2.9M, Input=I2024.12 | 0.103 | 0.937 | 0.903 | — | |
| Gaze-LLE ViT-LLearnable Params=2.9M2026.03 | 0.103 | 0.937 | 0.903 | — | |
| Jin et al.Learnable Params=>52M*, Input=I+D+P2024.12 | 0.104 | 0.9 | 0.895 | — | |
| Jin et al.Params=>52M*2026.06 | 0.104 | 0.9 | 0.895 | — | |
| Tonini et al. (2023)Ground Truth Gaze Matching=true2026.07 | 0.104 | 0.933 | 0.934 | — | |
| Tafasca et al. [61]Learnable Params=105M, Input=I2024.12 | 0.107 | — | 0.891 | — | |
| Gaze-LLE (ViT-B)Learnable Params=2.8M, Input=I2024.12 | 0.107 | 0.933 | 0.897 | — | |
| Gaze-LLE ViT-BLearnable Params=2.8M2026.03 | 0.107 | 0.933 | 0.897 | — | |
| SharinganParams=>135M*2026.06 | 0.107 | — | 0.891 | — | |
| Gaze-LLEParams=2.8M2026.06 | 0.107 | 0.933 | 0.897 | — | |
| Fang et al.Learnable Params=68M, Input=I+D+E2024.12 | 0.108 | 0.905 | 0.896 | — | |
| Fang et al.Learnable Params=68M2026.03 | 0.108 | 0.905 | 0.896 | — | |
| Fang2025.11 | 0.108 | 0.905 | 0.896 | — | |
| Fang et al.Params=68M2026.06 | 0.108 | 0.905 | 0.896 | — | |
| Miao et al.Learnable Params=61M, Input=I+D2024.12 | 0.109 | 0.917 | 0.908 | — | |
| Tafasca et al. [60]Learnable Params=>25M*, Input=I+D2024.12 | 0.109 | 0.914 | 0.834 | — | |
| Tafasca et al.Learnable Params=25M2026.03 | 0.109 | 0.914 | 0.834 | — | |
| Miao2025.11 | 0.109 | 0.917 | 0.908 | — | |
| Tafasca2025.11 | 0.109 | 0.914 | 0.834 | — | |
| Miao et al.Params=61M2026.06 | 0.109 | 0.917 | 0.908 | — | |
| Gupta et al.Learnable Params=35M, Input=I+D+P2024.12 | 0.11 | 0.914 | 0.879 | — | |
| Gupta et al.Learnable Params=35M2026.03 | 0.11 | 0.914 | 0.879 | — | |
| GazeVLMParams=2G2026.06 | 0.112 | 0.926 | 0.898 | — | |
| Hu et al.Learnable Params=>61M*, Input=I+D+O2024.12 | 0.118 | 0.88 | 0.881 | — | |
| Hu et al.Learnable Params=61M2026.03 | 0.118 | 0.88 | 0.881 | — | |
| Hu et al.Params=>61M*2026.06 | 0.118 | 0.88 | 0.881 | — | |
| Bao et al.Learnable Params=29M*, Input=I+D+P2024.12 | 0.12 | 0.885 | 0.869 | — | |
| ESCNetLearnable Params=29M2026.03 | 0.12 | 0.885 | 0.869 | — | |
| Bao2025.11 | 0.12 | 0.885 | 0.869 | — | |
| Tonini et al.Learnable Params=92M, Input=I+D2024.12 | 0.125 | 0.862 | 0.742 | — | |
| Tonini et al.Params=92M2026.06 | 0.125 | 0.862 | 0.742 | — | |
| Jin2025.11 | 0.127 | 0.87 | 0.882 | — | |
| Tonini2025.11 | 0.129 | 0.94 | — | — | |
| Chong et al. [9]Learnable Params=61M, Input=I2024.12 | 0.134 | 0.86 | 0.853 | — | |
| Chong et al.Learnable Params=61M2026.03 | 0.134 | 0.86 | 0.853 | — | |
| VideoAttn2025.11 | 0.134 | 0.86 | 0.853 | — | |
| Danyang2025.11 | 0.137 | 0.893 | 0.821 | — | |
| HGTTRParams=35M*2026.06 | 0.137 | 0.893 | 0.821 | — | |
| Tu et al. (2022)Ground Truth Gaze Matching=true2026.07 | 0.137 | 0.893 | 0.821 | — | |
| Lian2025.11 | 0.165 | 0.837 | — | — | |
| Chong et al. [8]Learnable Params=51M*, Input=I2024.12 | 0.171 | 0.833 | 0.712 | — | |
| Chong et al.Learnable Params=51M2026.03 | 0.171 | 0.833 | 0.712 | — | |
| Chong2025.11 | 0.193 | 0.83 | 0.705 | — | |
| Horanyi et al.Learnable Params=46M†, Input=I+D2024.12 | 0.199 | 0.832 | 0.8 | — | |
| Horanyi et al.Params=46M2026.06 | 0.199 | 0.832 | 0.8 | — | |
| Fixed Bias2025.11 | 0.326 | 0.728 | 0.624 | — | |
| Random2025.11 | 0.458 | 0.505 | 0.621 | — |