Automatic Speech Recognition on LRS3 High-Resource 433h labelled v1 (test)
0.012WERBRAVEn
Evaluation Results
| Method | Links | |
|---|---|---|
| BRAVEnPre-train data=LRS3+Vox2, Shared params=false, Model scale=Large2024.11 | 0.012 | |
| USRPre-train data=LRS3+Vox2, Shared params=true, Model scale=Large2024.11 | 0.012 | |
| AV-HuBERTPre-train data=LRS3+Vox2, Shared params=false, Model scale=Large2024.11 | 0.013 | |
| AV-data2vecPre-train data=LRS3+Vox2, Shared params=false, Model scale=Large2024.11 | 0.013 | |
| BRAVEnPre-train data=LRS3+Vox2, Shared params=false, Model scale=Base(+)2024.11 | 0.014 | |
| RAVEnPre-train data=LRS3+Vox2, Shared params=false, Model scale=Large2024.11 | 0.014 | |
| u-HuBERTPre-train data=LRS3+Vox2, Shared params=false, Model scale=Large2024.11 | 0.015 | |
| USRPre-train data=LRS3+Vox2, Shared params=true, Model scale=Base(+)2024.11 | 0.016 | |
| AV-data2vecPre-train data=LRS3+Vox2, Shared params=false, Model scale=Base(+)2024.11 | 0.017 | |
| BRAVEnPre-train data=LRS3, Shared params=false, Model scale=Base(+)2024.11 | 0.019 | |
| USRPre-train data=LRS3, Shared params=true, Model scale=Base(+)2024.11 | 0.019 | |
| RAVEnPre-train data=LRS3+Vox2, Shared params=false, Model scale=Base(+)2024.11 | 0.019 | |
| AV-data2vecPre-train data=LRS3, Shared params=false, Model scale=Base(+)2024.11 | 0.02 | |
| AV-HuBERTPre-train data=LRS3+Vox2, Shared params=false, Model scale=Base(+)2024.11 | 0.02 | |
| RAVEnPre-train data=LRS3, Shared params=false, Model scale=Base(+)2024.11 | 0.022 | |
| AV-HuBERTPre-train data=LRS3, Shared params=false, Model scale=Base(+)2024.11 | 0.03 |