Lip-reading on LRW-1000 (test)
55.7AccuracyRefined Network (SE+MixUp+Cosine LR+LS+WB)
Evaluation Results
| Method | Links | |
|---|---|---|
| Refined Network (SE+MixUp+Cosine LR+LS+WB)Year=2021, Frontend=SE-ResNet-18, Backend=BiGRU, Data Type=Aligned Lip + Word Boundary, Input Size=88x882020.11 | 55.7 | |
| MVMBackbone=R18, Method=MS-TCN / MVM2022.04 | 53.82 | |
| Multi-modality Associative BridgingInput Modality=Visual only, Memory slot size (N)=1122022.04 | 50.82 | |
| Kim et al. (2021b)Backbone=R18, Method=BiGRU / Mem2022.04 | 50.82 | |
| Refined Network (SE+MixUp+Cosine LR+LS+WB)Year=2021, Frontend=SE-ResNet-18, Backend=BiGRU, Data Type=Aligned Lip, Input Size=88x882020.11 | 48 | |
| Ma et al. (2021a)Backbone=R18, Method=MS-TCN / Born-Again2022.04 | 46.6 | |
| Face CutoutInput Modality=Visual only2022.04 | 45.24 | |
| Zhang et al. (2020b)Backbone=R18, Method=BiGRU / Face Cutout2022.04 | 45.24 | |
| Face Cutout (Zhang et al.)Year=2020, Frontend=ResNet-18, Backend=BiGRU, Data Type=Aligned Face, Input Size=112x1122020.11 | 45.2 | |
| Ma et al. (2021c)Backbone=R18, Method=DC-TCN2022.04 | 43.65 | |
| Multi-Stage Distillation (Ma et al.)Year=2020, Frontend=ResNet-18, Backend=MS-TCN, Data Type=Aligned Lip, Input Size=88x882020.11 | 43.2 | |
| DFTN2020.03 | 41.93 | |
| Deformation FlowInput Modality=Visual only2022.04 | 41.93 | |
| Xiao et al. (2020)Backbone=T R18, Method=BiGRU2022.04 | 41.93 | |
| Deformation Flow (Xiao et al.)Year=2020, Frontend=ResNet-18, Backend=BiGRU, Data Type=Lip, Input Size=88x882020.11 | 41.9 | |
| Multi-Scale TCNBackbone=ResNet18*2020.01 | 41.4 | |
| Temporal Convolution (Martinez et al.)Year=2020, Frontend=ResNet-18, Backend=MS-TCN, Data Type=Aligned Lip, Input Size=88x882020.11 | 41.4 | |
| MS-TCNInput Modality=Visual only2022.04 | 41.4 | |
| Martinez et al. (2020)Backbone=R18, Method=MS-TCN2022.04 | 41.4 | |
| GLMIM2020.03 | 38.79 | |
| MI MaximizationInput Modality=Visual only2022.04 | 38.79 | |
| Zhao et al. (2020a)Backbone=R18, Method=BiGRU + LSTM2022.04 | 38.79 | |
| PCPG2020.03 | 38.7 | |
| Policy Gradient (Luo et al.)Year=2020, Frontend=ResNet-18, Backend=BiGRU, Data Type=Lip, Input Size=88x882020.11 | 38.7 | |
| Mutual Information (Zhao et al.)Year=2020, Frontend=ResNet-18, Backend=BiGRU, Data Type=Lip, Input Size=88x882020.11 | 38.7 | |
| PCPGInput Modality=Visual only2022.04 | 38.7 | |
| Luo et al. (2020)Backbone=R18, Method=BiGRU + GRU2022.04 | 38.7 | |
| Baseline+LMIM2020.03 | 38.69 | |
| Baseline2020.03 | 38.35 | |
| ResNet + LSTMBackbone=ResNet34*2020.01 | 38.2 | |
| Stafylakis et al.Year=2017, Frontend=ResNet-34, Backend=BiLSTM, Data Type=Lip, Input Size=112x1122020.11 | 38.2 | |
| 3D+2Dreproduced=false2019.08 | 38.19 | |
| 3D+2D2020.03 | 38.19 | |
| Yang192020.03 | 38.19 | |
| Yang et al.2020.03 | 38.19 | |
| Yang et al.Input Modality=Visual only2022.04 | 38.19 | |
| Yang et al. (2019)Backbone=R34, Method=BiGRU2022.04 | 38.19 | |
| Multi-Grained Spatio-temporal Network2019.08 | 36.91 | |
| WangYear=20192020.03 | 36.91 | |
| Wang192020.03 | 36.91 | |
| Wang2020.03 | 36.91 | |
| Multi-GrainedInput Modality=Visual only2022.04 | 36.91 | |
| Multi-GrainedBackbone=ResNet34 + DenseNet3D2020.01 | 36.9 | |
| Multi-Grained (Wang et al.)Year=2019, Frontend=Multi-Grained ResNet-18, Backend=Conv BiLSTM, Data Type=Lip, Input Size=88x882020.11 | 36.9 | |
| D3D2019.08 | 34.76 | |
| D3DYear=20182020.03 | 34.76 | |
| 3D+2Dreproduced=true2019.08 | 33.78 | |
| LSTM-52019.08 | 25.76 | |
| LSTM-52020.03 | 25.76 | |
| Chung et al.Year=2016, Frontend=VGGM, Data Type=Lip, Input Size=112x1122020.11 | 25.7 |