Spoken Term Detection on LibriSpeech IV
0.02MTWV @ -5dB SNRHuBERT-Large
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| HuBERT-LargeDistortion=Noise + Reverberation, Representation=ASR Posteriors2025.12 | 0.02 | 0.06 | 0.09 | 0.13 | 0.21 | 0.24 | |
| SpeechTokenizerDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | 0.03 | 0.05 | 0.11 | 0.14 | 0.18 | 0.2 | |
| WavLM-LargeDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | 0.06 | 0.12 | 0.19 | 0.25 | 0.34 | 0.39 | |
| WavLM-LargeDistortion=Noise + Reverberation, Representation=ASR Posteriors2025.12 | 0.11 | 0.18 | 0.24 | 0.3 | 0.32 | 0.36 | |
| HuBERT-LargeDistortion=Noise, Representation=ASR Posteriors2025.12 | 0.13 | 0.21 | 0.3 | 0.4 | 0.47 | 0.47 | |
| SpeechTokenizerDistortion=Noise, Representation=SpeechTokens2025.12 | 0.14 | 0.27 | 0.39 | 0.49 | 0.52 | 0.53 | |
| WavLM-LargeDistortion=Noise, Representation=SpeechTokens2025.12 | 0.17 | 0.34 | 0.4 | 0.53 | 0.55 | 0.55 | |
| BEST-STDDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | 0.18 | 0.26 | 0.34 | 0.4 | 0.46 | 0.51 | |
| BEST-STDDistortion=Noise, Representation=SpeechTokens2025.12 | 0.27 | 0.35 | 0.43 | 0.5 | 0.57 | 0.62 | |
| WavLM-LargeDistortion=Noise, Representation=ASR Posteriors2025.12 | 0.31 | 0.36 | 0.43 | 0.52 | 0.55 | 0.58 | |
| Ours-TransformerDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | 0.41 | 0.5 | 0.55 | 0.58 | 0.58 | 0.6 | |
| BEST-STD 2.0Distortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | 0.45 | 0.53 | 0.61 | 0.67 | 0.68 | 0.68 | |
| Ours-TransformerDistortion=Noise, Representation=SpeechTokens2025.12 | 0.51 | 0.58 | 0.61 | 0.65 | 0.67 | 0.67 | |
| BEST-STD 2.0Distortion=Noise, Representation=SpeechTokens2025.12 | 0.58 | 0.64 | 0.72 | 0.75 | 0.77 | 0.77 |