Intent Classification on SLURP (test)
90.07Accuracy (IC)TDT 0-8
Evaluation Results
| Method | Links | |
|---|---|---|
| TDT 0-8#params (M)=119, relative speedup=1.28x, max duration=82023.04 | 90.07 | |
| TDT 0-4#params (M)=119, relative speedup=1.17x, max duration=42023.04 | 89.85 | |
| EF-hbt-largeFine-tuning strategy=Entire, Encoder Backbone=HuBERT, Model Size=Large2021.11 | 89.38 | |
| TDT 0-6#params (M)=119, relative speedup=1.28x, max duration=62023.04 | 89.28 | |
| PF-hbt-largeFine-tuning strategy=Partial, Encoder Backbone=HuBERT, Model Size=Large2021.11 | 89.22 | |
| EF-hbt-large-960hFine-tuning strategy=Entire, Encoder Backbone=HuBERT, Model Size=Large, Pre-training Corpus=960h2021.11 | 88.71 | |
| RNNT#params (M)=119, relative speedup=-2023.04 | 88.53 | |
| PF-hbt-large-960hFine-tuning strategy=Partial, Encoder Backbone=HuBERT, Model Size=Large, Pre-training Corpus=960h2021.11 | 88.32 | |
| SpeechBrain#params (M)=96, relative speedup=N/A2023.04 | 87.7 | |
| PF-hbt-baseFine-tuning strategy=Partial, Encoder Backbone=HuBERT, Model Size=Base2021.11 | 87.51 | |
| EF-hbt-baseFine-tuning strategy=Entire, Encoder Backbone=HuBERT, Model Size=Base2021.11 | 87.44 | |
| EF-w2v-baseFine-tuning strategy=Entire, Encoder Backbone=wav2vec 2.0, Model Size=Base2021.11 | 87.13 | |
| TDT 0-2#params (M)=119, relative speedup=1.17x, max duration=22023.04 | 87.12 | |
| CTI2021.11 | 86.92 | |
| PF-w2v-baseFine-tuning strategy=Partial, Encoder Backbone=wav2vec 2.0, Model Size=Base2021.11 | 86.58 | |
| ESPnet-SLU#params (M)=109, relative speedup=N/A2023.04 | 86.52 | |
| PF-w2v-large-960hFine-tuning strategy=Partial, Encoder Backbone=wav2vec 2.0, Model Size=Large, Pre-training Corpus=960h2021.11 | 86.35 | |
| PF-w2v-largeFine-tuning strategy=Partial, Encoder Backbone=wav2vec 2.0, Model Size=Large2021.11 | 86.29 | |
| PF-w2v-base-960hFine-tuning strategy=Partial, Encoder Backbone=wav2vec 2.0, Model Size=Base, Pre-training Corpus=960h2021.11 | 86.13 | |
| EF-w2v-large-960hFine-tuning strategy=Entire, Encoder Backbone=wav2vec 2.0, Model Size=Large, Pre-training Corpus=960h2021.11 | 86.1 | |
| EF-w2v-base-960hFine-tuning strategy=Entire, Encoder Backbone=wav2vec 2.0, Model Size=Base, Pre-training Corpus=960h2021.11 | 85.89 | |
| EF-w2v-largeFine-tuning strategy=Entire, Encoder Backbone=wav2vec 2.0, Model Size=Large2021.11 | 85.8 | |
| Frozen-hbt-largeFine-tuning strategy=Frozen, Encoder Backbone=HuBERT, Model Size=Large2021.11 | 74.42 | |
| Frozen-hbt-baseFine-tuning strategy=Frozen, Encoder Backbone=HuBERT, Model Size=Base2021.11 | 68.74 | |
| Frozen-w2v-baseFine-tuning strategy=Frozen, Encoder Backbone=wav2vec 2.0, Model Size=Base2021.11 | 47.15 | |
| Frozen-w2v-largeFine-tuning strategy=Frozen, Encoder Backbone=wav2vec 2.0, Model Size=Large2021.11 | 3.88 |