Audio-Visual Speech Recognition on LRS3 30h labeled low-resource (test)
1.8WERDistillAV-L
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DistillAV-LUnlab.=433h, Lab.=30h, Shared=false2025.10 | 1.8 | 11.9 | |
| UASR-LLM-BUnlab.=1759h, Lab.=30h, Shared=true2025.10 | 1.8 | 3.5 | |
| UASR-LLM-B*Unlab.=1759h, Lab.=30h, Shared=true2025.10 | 1.9 | 3.8 | |
| UASR-LLM-LUnlab.=1759h, Lab.=30h, Shared=true2025.10 | 1.9 | 3.5 | |
| UASR-LLM-LUnlab.=433h, Lab.=30h, Shared=true2025.10 | 2 | 4.4 | |
| UASR-LLM-BUnlab.=433h, Lab.=30h, Shared=true2025.10 | 2.1 | 4.8 | |
| DistillAV-LUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 2.1 | 8.1 | |
| DistillAV-BUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 2.2 | 9.2 | |
| USR-LUnlab.=1759h, Lab.=30h, Shared=true2025.10 | 2.4 | — | |
| USR-BUnlab.=1759h, Lab.=30h, Shared=true2025.10 | 2.5 | — | |
| VATLM-LUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 2.7 | — | |
| AV-data2vec-LUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 2.7 | — | |
| DistillAV-BUnlab.=433h, Lab.=30h, Shared=false2025.10 | 2.8 | 11.4 | |
| USRUnlab.=433h, Lab.=30h, Shared=true2025.10 | 3 | — | |
| AV-HuBERT-LUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 3.3 | — | |
| AV-data2vec-BUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 3.3 | — | |
| VATLM-BUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 3.4 | — | |
| AV-HuBERT-BUnlab.=1759h, Lab.=30h, Shared=false2025.10 | 4 | — | |
| AV-HuBERT-LUnlab.=433h, Lab.=30h, Shared=false2025.10 | 4.2 | — | |
| AV-data2vec-BUnlab.=433h, Lab.=30h, Shared=false2025.10 | 4.2 | — | |
| AV-HuBERT-BUnlab.=433h, Lab.=30h, Shared=false2025.10 | 4.7 | — | |
| AV2vec-MLMUnlab.=433h, Lab.=30h, Shared=false2025.10 | 5.4 | — |