Speech Recognition on LRS3 low-resource
23.7WER (V)USR 2.0
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| USR 2.0Model size=Large, Pre-training dataset=LRS3+Vox2, Shared params=true2026.02 | 23.7 | 2.3 | 2.2 | |
| USR 2.0Model size=Base+, Pre-training dataset=LRS3+Vox2, Shared params=true2026.02 | 26.4 | 2.5 | 2.4 | |
| USRModel size=Large, Pre-training dataset=LRS3+Vox2, Shared params=true2026.02 | 26.9 | 2.4 | 2.4 | |
| USRModel size=Base+, Pre-training dataset=LRS3+Vox2, Shared params=true2026.02 | 28.4 | 2.6 | 2.5 | |
| AV-data2vecModel size=Large, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 30.8 | 2.7 | 2.7 | |
| BRAVEnModel size=Large, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 30.8 | 2.3 | — | |
| AV-HuBERTModel size=Large, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 32.5 | 2.9 | 3.3 | |
| RAVEnModel size=Large, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 32.5 | 2.7 | — | |
| BRAVEnModel size=Base+, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 35.1 | 3 | — | |
| USRModel size=Base, Pre-training dataset=LRS3, Shared params=true2026.02 | 36 | 3.2 | 3 | |
| USR 2.0Model size=Base, Pre-training dataset=LRS3, Shared params=true2026.02 | 36.2 | 3 | 2.9 | |
| AV-data2vecModel size=Base+, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 37.8 | 3.7 | 3.3 | |
| RAVEnModel size=Base+, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 40.2 | 3.8 | — | |
| BRAVEnModel size=Base, Pre-training dataset=LRS3, Shared params=false2026.02 | 43.4 | 4 | 4 | |
| AV-data2vecModel size=Base, Pre-training dataset=LRS3, Shared params=false2026.02 | 45.2 | 4.4 | 4.2 | |
| AV-HuBERTModel size=Base+, Pre-training dataset=LRS3+Vox2, Shared params=false2026.02 | 46.1 | 4.6 | 4 | |
| RAVEnModel size=Base, Pre-training dataset=LRS3, Shared params=false2026.02 | 47 | 4.7 | — | |
| AV-HuBERTModel size=Base, Pre-training dataset=LRS3, Shared params=false2026.02 | 51.8 | 4.9 | 4.7 |