Spoken Term Detection on TIMIT (IV)
0.74MAPwav2tok 2.0
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| wav2tok 2.0Tokens=2562026.06 | 0.74 | — | — | — | — | — | — | 0.77 | 0.68 | |
| wav2tok 2.0Tokens=5122026.06 | 0.72 | — | — | — | — | — | — | 0.78 | 0.74 | |
| wav2tokTokens=2562026.06 | 0.71 | — | — | — | — | — | — | 0.74 | 0.66 | |
| wav2tok 2.0Tokens=10242026.06 | 0.69 | — | — | — | — | — | — | 0.75 | 0.75 | |
| wav2tokTokens=5122026.06 | 0.67 | — | — | — | — | — | — | 0.72 | 0.69 | |
| wav2tokTokens=10242026.06 | 0.63 | — | — | — | — | — | — | 0.68 | 0.68 | |
| BEST-STDTokens=2562026.06 | 0.62 | — | — | — | — | — | — | 0.64 | 0.57 | |
| BEST-STDTokens=5122026.06 | 0.61 | — | — | — | — | — | — | 0.66 | 0.63 | |
| BEST-STDTokens=10242026.06 | 0.57 | — | — | — | — | — | — | 0.62 | 0.62 | |
| Phone Posteriors2026.06 | 0.41 | — | — | — | — | — | — | 0.44 | 0.52 | |
| Speech TokenizerTokens=10242026.06 | 0.38 | — | — | — | — | — | — | 0.39 | 0.38 | |
| WavLM-BaseTokens=5122026.06 | 0.3 | — | — | — | — | — | — | 0.3 | 0.38 | |
| MFCC2026.06 | 0.29 | — | — | — | — | — | — | 0.37 | 0.48 | |
| WavLM-BaseTokens=10002026.06 | 0.26 | — | — | — | — | — | — | 0.27 | 0.3 | |
| HuBERT-BaseTokens=5122026.06 | 0.2 | — | — | — | — | — | — | 0.2 | 0.32 | |
| BNF2026.06 | 0.19 | — | — | — | — | — | — | 0.26 | 0.19 | |
| HuBERT-BaseTokens=10002026.06 | 0.19 | — | — | — | — | — | — | 0.17 | 0.23 | |
| EncodecTokens=10242026.06 | 0.08 | — | — | — | — | — | — | 0.08 | 0.13 | |
| BEST-STDDistortion=Noise, Representation=SpeechTokens2025.12 | — | 0.29 | 0.38 | 0.47 | 0.54 | 0.62 | 0.66 | — | — | |
| BEST-STDDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | — | 0.2 | 0.28 | 0.36 | 0.44 | 0.49 | 0.54 | — | — | |
| BEST-STD 2.0Distortion=Noise, Representation=SpeechTokens2025.12 | — | 0.6 | 0.67 | 0.78 | 0.8 | 0.81 | 0.82 | — | — | |
| BEST-STD 2.0Distortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | — | 0.47 | 0.54 | 0.63 | 0.67 | 0.7 | 0.71 | — | — | |
| HuBERT-LargeDistortion=Noise, Representation=ASR Posteriors2025.12 | — | 0.14 | 0.22 | 0.31 | 0.43 | 0.49 | 0.51 | — | — | |
| HuBERT-LargeDistortion=Noise + Reverberation, Representation=ASR Posteriors2025.12 | — | 0.03 | 0.08 | 0.12 | 0.23 | 0.25 | 0.27 | — | — | |
| Ours-TransformerDistortion=Noise, Representation=SpeechTokens2025.12 | — | 0.55 | 0.62 | 0.66 | 0.73 | 0.74 | 0.75 | — | — | |
| Ours-TransformerDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | — | 0.43 | 0.52 | 0.56 | 0.62 | 0.63 | 0.64 | — | — | |
| SpeechTokenizerDistortion=Noise, Representation=SpeechTokens2025.12 | — | 0.15 | 0.28 | 0.42 | 0.53 | 0.56 | 0.57 | — | — | |
| SpeechTokenizerDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | — | 0.05 | 0.12 | 0.18 | 0.19 | 0.23 | 0.23 | — | — | |
| WavLM-LargeDistortion=Noise, Representation=ASR Posteriors2025.12 | — | 0.33 | 0.35 | 0.44 | 0.52 | 0.55 | 0.61 | — | — | |
| WavLM-LargeDistortion=Noise, Representation=SpeechTokens2025.12 | — | 0.19 | 0.38 | 0.44 | 0.57 | 0.59 | 0.61 | — | — | |
| WavLM-LargeDistortion=Noise + Reverberation, Representation=ASR Posteriors2025.12 | — | 0.12 | 0.21 | 0.23 | 0.35 | 0.37 | 0.39 | — | — | |
| WavLM-LargeDistortion=Noise + Reverberation, Representation=SpeechTokens2025.12 | — | 0.08 | 0.16 | 0.23 | 0.26 | 0.3 | 0.36 | — | — |