Automatic Speech Recognition on SEAME SGE (dev)
14.9MERWhisper-large-v3 + ft full model
Evaluation Results
| Method | Links | |
|---|---|---|
| Whisper-large-v3 + ft full model#Train. Params.=1541.6 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 14.9 | |
| Whisper-Largev3Real Duration (h)=100, TTS-R Duration (h)=1002026.01 | 16 | |
| Whisper-medium + ft full model#Train. Params.=762.3 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 16.5 | |
| Whisper-Largev3Real Duration (h)=100, TTS-O Duration (h)=1002026.01 | 17 | |
| Whisper-Largev3Real Duration (h)=1002026.01 | 17.8 | |
| Whisper-small + ft full model + w/ FA-LID-LB#Train. Params.=240.6 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 18.3 | |
| Whisper-small + ft full model + w/ FA-LID-UB#Train. Params.=240.6 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 18.3 | |
| Whisper-small + ft full model + w/ LAL#Train. Params.=240.6 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 18.3 | |
| Whisper-small + ft full model#Train. Params.=240.6 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 18.4 | |
| Whisper-Largev3TTS-R Duration (h)=2002026.01 | 18.5 | |
| Whisper-Largev3TTS-O Duration (h)=1002026.01 | 18.6 | |
| Whisper-small + adapt. w/ LoRA#Train. Params.=4.4 M, pre-training (pt)=true, Tuning=adaptation tuning2025.09 | 18.7 | |
| Whisper-small + ft full model + w/ SPT*#Train. Params.=240.7 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 18.7 | |
| Whisper-small + ft full model + w/ CTC-LID#Train. Params.=240.6 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 18.8 | |
| Subsequent Iterative, M2Iteration=22026.07 | 18.89 | |
| Whisper-small + adapt. w/ Bi-LoRA#Train. Params.=4.4 M, pre-training (pt)=true, Tuning=adaptation tuning2025.09 | 19.3 | |
| First Iterative, M1Iteration=12026.07 | 19.47 | |
| Whisper-small + ft encoder-only#Train. Params.=87.0 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 19.5 | |
| Conformer + XLS-R-0.3B#Train. Params.=48.3 M, pre-training (pt)=true2025.09 | 21.6 | |
| Conformer + WavLM-large#Train. Params.=48.3 M, pre-training (pt)=true2025.09 | 21.9 | |
| Conformer + LLM GER#Train. Params.=48.3 M, pre-training (pt)=false2025.09 | 22 | |
| Whisper-Largev3TTS-R Duration (h)=1002026.01 | 22.4 | |
| E-Branchformer + CAMEL#Train. Params.=55.3 M, pre-training (pt)=false2025.09 | 22.8 | |
| Conformer + LPB#Train. Params.=79.9 M, pre-training (pt)=false2025.09 | 22.9 | |
| Conformer + ILB#Train. Params.=79.9 M, pre-training (pt)=false2025.09 | 23.2 | |
| Branchformer#Train. Params.=39.0 M, pre-training (pt)=false2025.09 | 23.2 | |
| E-Branchformer#Train. Params.=39.9 M, pre-training (pt)=false2025.09 | 23.2 | |
| Conformer#Train. Params.=48.3 M, pre-training (pt)=false2025.09 | 23.3 | |
| Conformer + LAL#Train. Params.=48.3 M, pre-training (pt)=false2025.09 | 23.3 | |
| ConExtBiMamba*#Train. Params.=54.6 M, pre-training (pt)=false2025.09 | 23.4 | |
| Transformer#Train. Params.=29.8 M, pre-training (pt)=false2025.09 | 24.5 | |
| Whisper-small + ft decoder-only#Train. Params.=153.6 M, pre-training (pt)=true, Tuning=full-parameter fine-tuning2025.09 | 25.8 | |
| Baseline2026.07 | 27.18 | |
| Whisper-large-v3pre-training (pt)=true2025.09 | 53.3 | |
| Initial bilingual, M0Iteration=02026.07 | 54.12 | |
| Whisper-mediumpre-training (pt)=true2025.09 | 62.6 | |
| Private model2026.07 | 64.53 | |
| Whisper-smallpre-training (pt)=true2025.09 | 69.7 |