Automatic Speech Recognition on Loquacious (dev)
5.52WERASR + DLM
Evaluation Results
| Method | Links | |
|---|---|---|
| ASR + DLMSystem=ASR + DLM2025.12 | 5.52 | |
| ASR + LMSystem=ASR + LM2025.12 | 5.63 | |
| ASR onlySystem=ASR only2025.12 | 6.45 | |
| Speaker+LenPre-train Split=Large, Selection method=Speaker+Len, Time (hrs)=201, Data (hrs)=12.5 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 16.6 | |
| LengthPre-train Split=Large, Selection method=Length, Time (hrs)=200, Data (hrs)=12.6 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 16.76 | |
| AllPre-train Split=Large, Selection method=All, Time (hrs)=263, Data (hrs)=25.2 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 17.12 | |
| SpeakerPre-train Split=Large, Selection method=Speaker, Time (hrs)=214, Data (hrs)=12.6 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 17.26 | |
| MFCCPre-train Split=Large, Selection method=MFCC, Time (hrs)=221, Data (hrs)=12.6 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 17.49 | |
| RandomPre-train Split=Large, Selection method=Random, Time (hrs)=214, Data (hrs)=12.6 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 17.53 | |
| SENSEPre-train Split=Large, Selection method=SENSE, Time (hrs)=385, Data (hrs)=12.6 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 17.67 | |
| LengthPre-train Split=Medium, Selection method=Length, Time (hrs)=202, Data (hrs)=1.25 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 18.08 | |
| Speaker+LenPre-train Split=Medium, Selection method=Speaker+Len, Time (hrs)=205, Data (hrs)=1.24 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 18.16 | |
| AllPre-train Split=Medium, Selection method=All, Time (hrs)=195, Data (hrs)=2.50 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 18.48 | |
| SpeakerPre-train Split=Medium, Selection method=Speaker, Time (hrs)=204, Data (hrs)=1.23 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 18.78 | |
| RandomPre-train Split=Medium, Selection method=Random, Time (hrs)=202, Data (hrs)=1.25 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 18.8 | |
| MFCCPre-train Split=Medium, Selection method=MFCC, Time (hrs)=202, Data (hrs)=1.24 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 19.05 | |
| SENSEPre-train Split=Medium, Selection method=SENSE, Time (hrs)=199, Data (hrs)=1.24 k, Fine-tuning split=small, Backbone=Conformer, Parameters=100M, Pre-training framework=BEST-RQ2026.01 | 19.23 | |
| No pre-trainSelection method=No pre-train, Fine-tuning split=small, Backbone=Conformer, Parameters=100M2026.01 | 22.3 |