Audio Speech Recognition on LRS3
0.7WERWhisper-Flamingo
Evaluation Results
| Method | Links | |
|---|---|---|
| Whisper-FlamingoLabelled hours=680,000, Lang. model=true, Shared params=false, Encoder=Whisper2026.02 | 0.7 | |
| Llama-AVSRPreprocessing=Lip crop & align2026.03 | 0.79 | |
| Llama-AVSRLabelled hours=680,000, Lang. model=true, Shared params=false, Encoder=Whisper2026.02 | 0.8 | |
| USR 2.0Labelled hours=656, Unlabelled hours=2,649, Lang. model=false, Shared params=true2026.02 | 0.9 | |
| Auto-AVSRLabelled hours=1,902, Language model=true, Shared params=false2024.11 | 1 | |
| Auto-AVSRLabelled hours=3,448, Language model=true, Shared params=false2024.11 | 1 | |
| Auto-AVSRLabelled hours=1,902, Lang. model=true, Shared params=false2026.02 | 1 | |
| Auto-AVSRLabelled hours=3,448, Lang. model=true, Shared params=false2026.02 | 1 | |
| BRAVEn w/ STLabelled hours=433, Unlabelled hours=2,649, Lang. model=true, Shared params=false2026.02 | 1.1 | |
| USRLabelled hours=433, Unlabelled hours=1,326, Language model=true, Shared params=true2024.11 | 1.2 | |
| USRLabelled hours=433, Unlabelled hours=1,326, Lang. model=true, Shared params=true2026.02 | 1.2 | |
| RAVEn w/ STLabelled hours=433, Unlabelled hours=1,326, Language model=true, Shared params=false2024.11 | 1.4 | |
| RAVEn w/ STLabelled hours=433, Unlabelled hours=1,326, Lang. model=true, Shared params=false2026.02 | 1.4 | |
| Qwen2.5-OmniPreprocessing=Raw video2026.03 | 3.63 | |
| HumanOmni-SpeakerPreprocessing=Raw video2026.03 | 3.63 | |
| OLAPreprocessing=Raw video2026.03 | 4.7 | |
| RNN-TLabelled hours=31,000, Language model=true, Shared params=false2024.11 | 4.8 | |
| RNN-TLabelled hours=31,000, Lang. model=false, Shared params=true2026.02 | 4.8 |