Audio-Visual Speech Recognition on MISP 2021 (test)
0.1882CERM2S-AVROVER
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| M2S-AVROVERYear=2026, Training Data (hrs) - Audio=600†, Training Data (hrs) - Video=LRS3+Vox2(En), Backbone=Transformer2026.06 | 0.1882 | — | |
| MDA-KDTraining Data (Audio)=1000 hours, Training Data (Video)=w/o extra data, Backbone=Conformer, Objective Function=ED + InterCTC2024.03 | 0.2153 | — | |
| M2S-AVYear=2026, Training Data (hrs) - Audio=600†, Training Data (hrs) - Video=LRS3+Vox2(En), Backbone=Transformer2026.06 | 0.2195 | — | |
| ModalBiasAVSRYear=2024, Training Data (hrs) - Audio=1000, Training Data (hrs) - Video=w/o extra, Backbone=Conformer2026.06 | 0.2213 | — | |
| USTCTraining Data (Audio)=500 hours, Training Data (Video)=w/o extra data, Backbone=Conformer, Objective Function=ED2024.03 | 0.2458 | — | |
| USTCYear=2023, Training Data (hrs) - Audio=500, Training Data (hrs) - Video=w/o extra, Backbone=Conformer2026.06 | 0.2458 | — | |
| NIOTraining Data (Audio)=3300 hours, Training Data (Video)=LRW-1000, Backbone=Transformer, Objective Function=ED2024.03 | 0.2507 | — | |
| NIOYear=2022, Training Data (hrs) - Audio=3300, Training Data (hrs) - Video=LRW-1000, Backbone=Transformer2026.06 | 0.2507 | — | |
| M2S-AYear=2026, Training Data (hrs) - Audio=600†, Training Data (hrs) - Video=–, Backbone=Transformer2026.06 | 0.2508 | — | |
| Whisper-FlamingoYear=2025, Training Data (hrs) - Audio=600†, Training Data (hrs) - Video=LRS3+Vox2(En), Backbone=Transformer2026.06 | 0.2608 | — | |
| SJTUTraining Data (Audio)=300 hours, Training Data (Video)=LRW-1000, Backbone=Conformer, Objective Function=ED + SE2024.03 | 0.3402 | — | |
| SJTUYear=2022, Training Data (hrs) - Audio=300, Training Data (hrs) - Video=LRW-1000 [90], Backbone=Conformer2026.06 | 0.3402 | — | |
| M2S-VYear=2026, Training Data (hrs) - Audio=–, Training Data (hrs) - Video=LRS3+Vox2(En), Backbone=Transformer2026.06 | 0.7635 | — |