Gaze target estimation on GazeFollow
0.069Avg L2 DistanceTonini et al. (2023)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Tonini et al. (2023)Ground Truth Gaze Matching=true2026.07 | 0.069 | 0.922 | 0.029 | — | — | |
| PaGEGround Truth Gaze Matching=false2026.07 | 0.08 | 0.966 | 0.029 | — | — | |
| OmniGF2026.05 | 0.092 | — | 0.04 | — | — | |
| multi-scale object-aware frameworkParams=7.1M2026.06 | 0.094 | 0.961 | 0.038 | — | — | |
| One Human2024.12 | 0.096 | 0.924 | 0.04 | — | — | |
| Human ExpertLearnable Params=-2026.03 | 0.096 | 0.924 | — | — | — | |
| Gaze-LLE (ViT-L)Learnable Params=2.9M, Input=I2024.12 | 0.099 | 0.958 | 0.041 | — | — | |
| Gaze-LLE ViT-LLearnable Params=2.9M2026.03 | 0.099 | 0.958 | — | — | — | |
| FGI-GazeParams=35M*2026.06 | 0.099 | 0.95 | 0.044 | — | — | |
| GazeMoELearnable Params=3.4M2026.03 | 0.101 | 0.959 | — | — | — | |
| Gaze-LLE (ViT-B)Learnable Params=2.8M, Input=I2024.12 | 0.104 | 0.956 | 0.045 | — | — | |
| Gaze-LLE ViT-BLearnable Params=2.8M2026.03 | 0.104 | 0.956 | — | — | — | |
| Gaze-LLEParams=2.8M2026.06 | 0.104 | 0.956 | 0.045 | — | — | |
| Semgaze2026.05 | 0.108 | — | 0.051 | — | — | |
| Chen et al.Params=49.4M*2026.06 | 0.108 | 0.934 | 0.07 | — | — | |
| Semgaze*training_labels=refined ground-truth labels2026.05 | 0.109 | — | 0.053 | — | — | |
| Tafasca et al. [61]Learnable Params=105M, Input=I2024.12 | 0.113 | 0.944 | 0.057 | — | — | |
| SharinganParams=>135M*2026.06 | 0.113 | 0.944 | 0.057 | — | — | |
| Gupta et al.Learnable Params=35M, Input=I+D+P2024.12 | 0.114 | 0.943 | 0.056 | — | — | |
| Gupta et al.Learnable Params=35M2026.03 | 0.114 | 0.943 | — | — | — | |
| GTRParams=48.2M*2026.06 | 0.114 | 0.928 | 0.057 | — | — | |
| Tu et al. (2023)Ground Truth Gaze Matching=true2026.07 | 0.114 | 0.928 | 0.057 | — | — | |
| Jin et al.Learnable Params=>52M*, Input=I+D+P2024.12 | 0.118 | 0.92 | 0.063 | — | — | |
| Jin et al.Params=>52M*2026.06 | 0.118 | 0.92 | 0.063 | — | — | |
| Jin2025.11 | 0.12 | 0.923 | 0.064 | 14.8 | — | |
| Bao et al.Learnable Params=29M*, Input=I+D+P2024.12 | 0.122 | 0.928 | — | — | — | |
| Tafasca et al. [60]Learnable Params=>25M*, Input=I+D2024.12 | 0.122 | 0.939 | 0.062 | — | — | |
| Tafasca et al.Learnable Params=25M2026.03 | 0.122 | 0.939 | — | — | — | |
| ESCNetLearnable Params=29M2026.03 | 0.122 | 0.928 | — | — | — | |
| Bao2025.11 | 0.122 | 0.928 | — | 14.6 | — | |
| Tafasca2025.11 | 0.122 | 0.939 | 0.062 | — | — | |
| Miao et al.Learnable Params=61M, Input=I+D2024.12 | 0.123 | 0.934 | 0.065 | — | — | |
| Miao2025.11 | 0.123 | 0.934 | 0.065 | — | — | |
| GazeVLM2025.11 | 0.123 | 0.936 | 0.061 | 14.2 | 0.23 | |
| Miao et al.Params=61M2026.06 | 0.123 | 0.934 | 0.065 | — | — | |
| Fang et al.Learnable Params=68M, Input=I+D+E2024.12 | 0.124 | 0.922 | 0.067 | — | — | |
| Fang et al.Learnable Params=68M2026.03 | 0.124 | 0.922 | — | — | — | |
| Fang2025.11 | 0.124 | 0.922 | 0.067 | 14.9 | — | |
| Fang et al.Params=68M2026.06 | 0.124 | 0.922 | 0.067 | — | — | |
| Hu et al.Learnable Params=>61M*, Input=I+D+O2024.12 | 0.128 | 0.923 | 0.069 | — | — | |
| Hu et al.Learnable Params=61M2026.03 | 0.128 | 0.923 | — | — | — | |
| Hu et al.Params=>61M*2026.06 | 0.128 | 0.923 | 0.069 | — | — | |
| GazeVLMParams=2G2026.06 | 0.131 | 0.929 | 0.076 | — | — | |
| Danyang2025.11 | 0.133 | 0.917 | 0.069 | — | — | |
| HGTTRParams=35M*2026.06 | 0.133 | 0.917 | 0.069 | — | — | |
| Tu et al. (2022)Ground Truth Gaze Matching=true2026.07 | 0.133 | 0.917 | 0.069 | — | — | |
| Chen et al.Learnable Params=50M*, Input=I2024.12 | 0.136 | 0.908 | 0.074 | — | — | |
| Chong et al. [9]Learnable Params=61M, Input=I2024.12 | 0.137 | 0.921 | 0.077 | — | — | |
| Chong et al.Learnable Params=61M2026.03 | 0.137 | 0.921 | — | — | — | |
| VideoAttn2025.11 | 0.137 | 0.921 | 0.077 | — | — | |
| Tonini et al.Learnable Params=92M, Input=I+D2024.12 | 0.141 | 0.927 | — | — | — | |
| Tonini2025.11 | 0.141 | 0.927 | — | — | — | |
| Tonini et al.Params=92M2026.06 | 0.141 | 0.927 | — | — | — | |
| Lian et al.Learnable Params=55M, Input=I2024.12 | 0.145 | 0.906 | 0.081 | — | — | |
| Lian2025.11 | 0.145 | 0.906 | 0.081 | 17.6 | — | |
| Chong et al. [8]Learnable Params=51M*, Input=I2024.12 | 0.187 | 0.896 | 0.112 | — | — | |
| Chong et al.Learnable Params=51M2026.03 | 0.187 | 0.896 | — | — | — | |
| Chong2025.11 | 0.187 | 0.896 | 0.112 | — | — | |
| Recasens et al.Learnable Params=50M*, Input=I2024.12 | 0.19 | 0.878 | 0.113 | — | — | |
| Recasens et al.Learnable Params=50M2026.03 | 0.19 | 0.878 | — | — | — | |
| Recansens2025.11 | 0.19 | 0.878 | 0.113 | 24 | — | |
| Horanyi et al.Learnable Params=46M†, Input=I+D2024.12 | 0.196 | 0.896 | 0.127 | — | — | |
| Horanyi et al.Params=46M2026.06 | 0.196 | 0.896 | 0.127 | — | — | |
| Tonini et al. (2023)Ground Truth Gaze Matching=false, Evaluation Source=Ryan et al. (2025)2026.07 | 0.211 | 0.767 | 0.148 | — | — | |
| Fixed Bias2025.11 | 0.306 | 0.674 | 0.219 | 48 | — | |
| Center2025.11 | 0.313 | 0.633 | 0.23 | 49 | — | |
| Random2025.11 | 0.484 | 0.504 | 0.391 | 69 | — |