Automatic Speech Recognition on LRS2-BBC (test)
0.056WERWhisper (real label)
Evaluation Results
| Method | Links | |
|---|---|---|
| Whisper (real label)Adaptation strategy=Finetuning, Supervision type=Supervised2024.05 | 0.056 | |
| STARAdaptation strategy=STAR, Supervision type=Unsupervised2024.05 | 0.07 | |
| TOKreweight (A_t)Adaptation strategy=Self-training, Token-level re-weighting=A_t, Supervision type=Unsupervised2024.05 | 0.074 | |
| UTTfilterAdaptation strategy=Self-training, Filtering=Utterance-level, Supervision type=Unsupervised2024.05 | 0.076 | |
| TOKreweight (G_t)Adaptation strategy=Self-training, Token-level re-weighting=G_t, Supervision type=Unsupervised2024.05 | 0.079 | |
| TM-CTCModality=Audio-Visual, External Language Model=true2018.09 | 0.082 | |
| Whisper (self-train.)Adaptation strategy=Self-training, Supervision type=Unsupervised2024.05 | 0.083 | |
| TM-seq2seqModality=Audio-Visual, External Language Model=true2018.09 | 0.085 | |
| Whisper (frozen)Adaptation strategy=None, Supervision type=Zero-shot2024.05 | 0.085 | |
| TM-seq2seqModality=Audio-Visual, External Language Model=false2018.09 | 0.094 | |
| TM-seq2seqModality=Audio, External Language Model=true2018.09 | 0.097 | |
| TM-CTCModality=Audio, External Language Model=true2018.09 | 0.101 | |
| TM-seq2seqModality=Audio, External Language Model=false2018.09 | 0.105 | |
| TM-CTCModality=Audio-Visual, External Language Model=false2018.09 | 0.137 | |
| TM-CTCModality=Audio, External Language Model=false2018.09 | 0.153 | |
| Google S2T+Modality=Audio, External Language Model=false2018.09 | 0.209 | |
| TM-seq2seqModality=Video, External Language Model=true2018.09 | 0.483 | |
| TM-seq2seqModality=Video, External Language Model=false2018.09 | 0.498 | |
| TM-CTCModality=Video, External Language Model=true2018.09 | 0.547 | |
| TM-CTCModality=Video, External Language Model=false2018.09 | 0.65 | |
| WASModality=Video, External Language Model=false2018.09 | 0.704 |