Egocentric visual attention prediction on Aria Everyday Activities (AEA) (test)
60.3F1 ScoreLanguage-guided scene context-aware learning framework
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Language-guided scene context-aware learning frameworkAdditional sensory modality=video frame only2026.01 | 60.3 | 67.2 | 54.7 | |
| CSTSAdditional sensory modality=audio2026.01 | 59.9 | 66.8 | 54.3 | |
| GLCAdditional sensory modality=video frame only2026.01 | 58.3 | 65.4 | 52.6 | |
| DFG+Additional sensory modality=video frame only2026.01 | 57.6 | 65.5 | 51.3 | |
| MViTAdditional sensory modality=video frame only2026.01 | 57.5 | 62.4 | 53.3 | |
| AttnTransAdditional sensory modality=flow2026.01 | 57.4 | 65.5 | 51 | |
| I3D-R50Additional sensory modality=video frame only2026.01 | 57.4 | 63.6 | 52.2 | |
| DFGAdditional sensory modality=video frame only2026.01 | 57.4 | 63.6 | 52.3 | |
| GazeMLEAdditional sensory modality=flow2026.01 | 56.8 | 64.1 | 51 |