Audio-Visual Speech Recognition on LRS3 Clean original (test)
0.65WERM2S-AVSR
Evaluation Results
| Method | Links | |
|---|---|---|
| M2S-AVSRModality=A+V, Total Params=2.6B, Noise Dataset=LRS3, Labeled Training Data (hrs)=ms1,759, Unlabeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 0.65 | |
| M2S-AVSRModality=A+V, Total Params=2.6B, Noise Dataset=LRS3, Labeled Training Data (hrs)=1,759, Unlabeled Training Data (hrs)=1,759, Multi-view Synthesis=false2026.06 | 0.68 | |
| MMS-LlamaModality=A+V, Total Params=3.2B, Noise Dataset=NoiseX, Labeled Training Data (hrs)=1,759, Unlabeled Training Data (hrs)=1,7592026.06 | 0.72 | |
| Llama-AVSRModality=A+V, Total Params=8.7B, Noise Dataset=NoiseX, Labeled Training Data (hrs)=1,759, Unlabeled Training Data (hrs)=1,7592026.06 | 0.77 | |
| M2S-AVSRModality=A+V, Total Params=2.6B, Noise Dataset=LRS3, Labeled Training Data (hrs)=433, Unlabeled Training Data (hrs)=1,759, Multi-view Synthesis=false2026.06 | 0.82 | |
| M2S-AVSRModality=A+V, Total Params=2.6B, Noise Dataset=LRS3, Labeled Training Data (hrs)=ms433, Unlabeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 0.82 | |
| Auto-AVSRModality=A+V, Total Params=443M, Noise Dataset=NoiseX, Labeled Training Data (hrs)=3,4482026.06 | 0.9 | |
| MMS-LlamaModality=A+V, Total Params=3.2B, Noise Dataset=NoiseX, Labeled Training Data (hrs)=433, Unlabeled Training Data (hrs)=1,7592026.06 | 0.9 | |
| Qwen3-ASRModality=A, Total Params=1.7B, Noise Dataset=LRS3, Unlabeled Training Data (hrs)=∼ 4.0 × 10^7, LLM-based (No Fine-tuning)=true2026.06 | 1.39 | |
| AV-HuBERTModality=A+V, Total Params=477M, Noise Dataset=LRS3, Labeled Training Data (hrs)=433, Unlabeled Training Data (hrs)=1,7592026.06 | 1.4 | |
| CMAModality=A+V, Total Params=505M, Noise Dataset=LRS3, Labeled Training Data (hrs)=433, Unlabeled Training Data (hrs)=1,7592026.06 | 1.5 | |
| Whisper-FlamingoModality=A+V, Total Params=2.5B, Noise Dataset=LRS3, Labeled Training Data (hrs)=433, Unlabeled Training Data (hrs)=1,7592026.06 | 1.5 | |
| Whisper-FlamingoModality=A+V, Total Params=2.5B, Noise Dataset=LRS3, Labeled Training Data (hrs)=ms433, Unlabeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 1.5 | |
| Whisper-FlamingoModality=A+V, Total Params=2.5B, Noise Dataset=LRS3, Labeled Training Data (hrs)=ms1,759, Unlabeled Training Data (hrs)=ms1,759, Multi-view Synthesis=true2026.06 | 1.95 | |
| Whisper-finetunedModality=A, Total Params=1.6B, Noise Dataset=LRS3, Labeled Training Data (hrs)=1,7592026.06 | 2 | |
| Whisper-FlamingoModality=A+V, Total Params=2.5B, Noise Dataset=LRS3, Labeled Training Data (hrs)=1,759, Unlabeled Training Data (hrs)=1,7592026.06 | 2 | |
| Whisper-finetunedModality=A, Total Params=1.6B, Noise Dataset=LRS3, Labeled Training Data (hrs)=4332026.06 | 2.3 | |
| AV-RelScoreModality=A+V, Total Params=136M, Noise Dataset=NoiseX, Labeled Training Data (hrs)=4332026.06 | 2.77 | |
| V-CAFEModality=A+V, Total Params=109M, Noise Dataset=NoiseX, Labeled Training Data (hrs)=4332026.06 | 2.82 | |
| Fun-ASR-NanoModality=A, Total Params=0.8B, Noise Dataset=LRS3, Labeled Training Data (hrs)=millions, Unlabeled Training Data (hrs)=tens of millions, LLM-based (No Fine-tuning)=true2026.06 | 2.96 | |
| FireRed-ASRModality=A, Total Params=1.1B, Noise Dataset=LRS3, Labeled Training Data (hrs)=∼ 8.1 × 10^4, LLM-based (No Fine-tuning)=true2026.06 | 3.77 |