Audio-Visual Speech Recognition on MISP2022 (test)
28.06cpCERMDA-KD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MDA-KDTraining Data (Audio)=1000 hours, Training Data (Video)=w/o extra data, Backbone=Conformer, Objective Function=ED + InterCTC2024.03 | 28.06 | — | |
| NPUTraining Data (Audio)=1300 hours, Training Data (Video)=w/o extra data, Backbone=E-Branchformer, Objective Function=ED + InterCTC2024.03 | 29.13 | — | |
| NIOTraining Data (Audio)=3300 hours, Training Data (Video)=LRW-1000, Backbone=Conformer, Objective Function=ED2024.03 | 29.58 | — | |
| XMUTraining Data (Audio)=2100 hours, Training Data (Video)=LRW-1000, Backbone=Conformer, Objective Function=ED + InterCTC2024.03 | 31.88 | — |