Audio-Visual Speech Recognition on LRS3 Noisy w.r.t Viewpoint 5° Offset (test)
3.86WERM2S-AVSR
Evaluation Results
| Method | Links | |
|---|---|---|
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 3.86 | |
| MMS-LlamaModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 3.95 | |
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 4 | |
| Auto-AVSRModality=A+V, Labeled Training Data (hrs)=3,4482026.06 | 4.63 | |
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=ms433, Multi-view Synthesis=true2026.06 | 4.83 | |
| MMS-LlamaModality=A+V, Labeled Training Data (hrs)=4332026.06 | 4.9 | |
| M2S-AVSRModality=A+V, Labeled Training Data (hrs)=4332026.06 | 5.58 | |
| Llama-AVSRModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 6 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 6.36 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=1,7592026.06 | 6.37 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=ms433, Multi-view Synthesis=true2026.06 | 6.84 | |
| Whisper-FlamingoModality=A+V, Labeled Training Data (hrs)=4332026.06 | 6.86 | |
| CMAModality=A+V, Labeled Training Data (hrs)=4332026.06 | 7.94 | |
| AV-HuBERTModality=A+V, Labeled Training Data (hrs)=4332026.06 | 9.6 | |
| AV-RelScoreModality=A+V, Labeled Training Data (hrs)=4332026.06 | 10.4 | |
| V-CAFEModality=A+V, Labeled Training Data (hrs)=4332026.06 | 14.26 |