Visual Speech Recognition on DVSpeaker (Cross-scene)
71.68SI (45°)NeuroLip
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| NeuroLip#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Weighted Voxel, Train=SI-0°2026.04 | 71.68 | 3.64 | 75.94 | |
| EST#Subjects=50, Mode=Dyn.+Sta., Backbone=VGG, Representation=Spike Tensor, Train=SI-0°2026.04 | 51.86 | 5.02 | 1.98 | |
| Slowfast#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 50.2 | 3.9 | 28.4 | |
| Get#Subjects=50, Mode=Dyn.+Sta., Backbone=Transformer, Representation=Group Token, Train=SI-0°2026.04 | 50.1 | 5.7 | 37.3 | |
| ANN#Subjects=50, Mode=Dyn.+Sta., Backbone=BiGRU, Representation=Frame, Train=SI-0°2026.04 | 37.5 | 4.6 | 12.62 | |
| MTGA#Subjects=50, Mode=Dyn.+Sta., Backbone=Transformer, Representation=Frame+Graph, Train=SI-0°2026.04 | 27.6 | 3.2 | 30 | |
| Slowonly#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 26.9 | 5.3 | 49.4 | |
| Tsn#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 26 | 4.5 | 19.6 | |
| R2plus1d#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 25.1 | 3.7 | 60.4 | |
| SpikGRU2+#Subjects=50, Mode=Dyn.+Sta., Backbone=Spiking GRU, Representation=Raw, Train=SI-0°2026.04 | 23.7 | 5.6 | 3.1 | |
| C2d#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 20.3 | 5.1 | 67.4 | |
| Tanet#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 20.2 | 2.9 | 47.3 | |
| Tsm#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 19.3 | 5.5 | 43.8 | |
| Timesformer#Subjects=50, Mode=Dyn.+Sta., Backbone=Transformer, Representation=Frame, Train=SI-0°2026.04 | 17.3 | 3 | 32.3 | |
| Trn#Subjects=50, Mode=Dyn.+Sta., Backbone=Inception, Representation=Frame, Train=SI-0°2026.04 | 17.3 | 4.2 | 27.7 | |
| Tin#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 17.2 | 4.3 | 41.7 | |
| C3d#Subjects=50, Mode=Dyn.+Sta., Backbone=CNN, Representation=Frame, Train=SI-0°2026.04 | 11.7 | 2.3 | 66.7 | |
| Uniformerv2#Subjects=50, Mode=Dyn.+Sta., Backbone=Transformer, Representation=Frame, Train=SI-0°2026.04 | 9.5 | 4.5 | 4.3 | |
| EV-Gait#Subjects=50, Mode=Dyn.+Sta., Backbone=CNN, Representation=Frame, Train=SI-0°2026.04 | 8.2 | 2.1 | 4 | |
| EgoEvGesture#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Event Surfaces, Train=SI-0°2026.04 | 3.92 | 3.02 | 2.04 | |
| MSTP#Subjects=50, Mode=Dyn.+Sta., Backbone=ResNet, Representation=Frame, Train=SI-0°2026.04 | 2.4 | 3.6 | 3.9 |