Audio-Visual Speech Recognition on LRS3 Noisy w.r.t Viewpoint 15° Offset (test)
4.05WERM2S-AVSR
Evaluation Results
| Method | Links | |
|---|---|---|
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 4.05 | |
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=ms433, Multi-view Synthesis=true2026.06 | 5.78 | |
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 5.95 | |
| MMS-LlamaModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 6.19 | |
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=4332026.06 | 6.78 | |
| Auto-AVSRModality=A+V, Labeled Training Data (hrs)=3,4482026.06 | 6.86 | |
| MMS-LlamaModality=A+V, Labeled Training Data (hrs)=4332026.06 | 6.93 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 7.25 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 7.26 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=ms433, Multi-view Synthesis=true2026.06 | 7.3 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=4332026.06 | 7.39 | |
| Llama-AVSRModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 9.48 | |
| CMAModality=A+V, Labeled Training Data (hrs)=4332026.06 | 11.93 | |
| AV-RelScoreModality=A+V, Labeled Training Data (hrs)=4332026.06 | 12.45 | |
| AV-HuBERTModality=A+V, Labeled Training Data (hrs)=4332026.06 | 14.08 | |
| V-CAFEModality=A+V, Labeled Training Data (hrs)=4332026.06 | 15.59 |