Speech Recognition on LibriSpeech 960hr (dev)
1.1WERwav2vec 2.0
Evaluation Results
| Method | Links | |
|---|---|---|
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 1.1 | |
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 1.3 | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 1.3 | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 1.3 | |
| w2v-Conformer XXL+Unlabeled Data (hrs)=60k, AM Size (B)=1.1, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 1.3 | |
| w2v-Conformer XXL+Unlabeled Data (hrs)=60k, AM Size (B)=1.1, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 1.3 | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 1.3 | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 1.3 | |
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=With LM2021.08 | 1.3 | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 1.4 | |
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 1.4 | |
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training + Self-training, Decoding Strategy=No LM2021.08 | 1.4 | |
| HuBERT LargeUnlabeled Data (hrs)=60k, AM Size (B)=0.3, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 1.5 | |
| HuBERT X-LargeUnlabeled Data (hrs)=60k, AM Size (B)=1.0, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 1.5 | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 1.5 | |
| w2v-BERT XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 1.5 | |
| w2v-BERT XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 1.5 | |
| Conformer L with NSTUnlabeled Data (hrs)=60k, AM Size (B)=0.1, LM Size (B)=0.1, Training Strategy=Self-training Only, Decoding Strategy=No LM2021.08 | 1.6 | |
| Conformer L with NSTUnlabeled Data (hrs)=60k, AM Size (B)=0.1, LM Size (B)=0.1, Training Strategy=Self-training Only, Decoding Strategy=With LM2021.08 | 1.6 | |
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4+, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 1.6 | |
| w2v-Conformer XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=With LM2021.08 | 1.6 | |
| w2v-Conformer XXLUnlabeled Data (hrs)=60k, AM Size (B)=1.0, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 1.6 | |
| w2v-Conformer XLUnlabeled Data (hrs)=60k, AM Size (B)=0.6, LM Size (B)=0.1, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 1.7 | |
| Conformer LUnlabeled Data (hrs)=N/A, AM Size (B)=0.1, LM Size (B)=0.1, Training Strategy=Trained from Scratch, Decoding Strategy=No LM2021.08 | 1.9 | |
| wav2vec 2.0Unlabeled Data (hrs)=60k, AM Size (B)=0.3, LM Size (B)=> 0.4+, Training Strategy=Pre-training Only, Decoding Strategy=No LM2021.08 | 2.1 |