Automatic Speech Recognition on Telephony long (test)
10.72WERConformerXL-RNNT-PS (Fine-tuned)
Evaluation Results
| Method | Links | |
|---|---|---|
| ConformerXL-RNNT-PS (Fine-tuned)Fine-tuning Mixture (Telephony)=0.8, Fine-tuning Mixture (Video)=0.2, Fine-tuning Mixture (NST)=N/A2021.09 | 10.72 | |
| ConformerXL-RNNT-PS (Baseline)Fine-tuning Mixture (Telephony)=N/A, Fine-tuning Mixture (Video)=N/A, Fine-tuning Mixture (NST)=N/A2021.09 | 10.97 | |
| ConformerXL-RNNT-PFine-tuning Mixture (Telephony)=0.8, Fine-tuning Mixture (Video)=0.2, Fine-tuning Mixture (NST)=N/A2021.09 | 14.55 | |
| Streaming Model (Baseline)Fine-tuning Mixture (Telephony)=N/A, Fine-tuning Mixture (Video)=N/A, Fine-tuning Mixture (NST)=N/A2021.09 | 15.53 | |
| Student Streaming ModelFine-tuning Mixture (Telephony)=0.8, Fine-tuning Mixture (Video)=0.2, Fine-tuning Mixture (NST)=0.22021.09 | 16.75 | |
| Streaming Model (Fine-tuned)Fine-tuning Mixture (Telephony)=0.8, Fine-tuning Mixture (Video)=0.2, Fine-tuning Mixture (NST)=N/A2021.09 | 19.92 | |
| Streaming Model (Fine-tuned)Fine-tuning Mixture (Telephony)=1.0, Fine-tuning Mixture (Video)=N/A, Fine-tuning Mixture (NST)=N/A2021.09 | 21.41 |