Non-verbal Vocalization Detection on 800-hour curated dataset (test)
100PrecisionWhisper-D
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Whisper-DNV=swallow, parameters=1.55B, backbone=Whisper-v2-large2026.07 | 100 | 0.8 | 1.5 | |
| NV-ASRNV=swallow, parameters=200M, architecture=RNN-Transducer, encoder=Emformer2026.07 | 95.4 | 78.6 | 86.2 | |
| NV-ASRNV=cough, parameters=200M, architecture=RNN-Transducer, encoder=Emformer2026.07 | 91.4 | 86.7 | 89 | |
| Whisper-DNV=cry, parameters=1.55B, backbone=Whisper-v2-large2026.07 | 90.8 | 42.1 | 57.6 | |
| Whisper-DNV=cough, parameters=1.55B, backbone=Whisper-v2-large2026.07 | 90.5 | 63.3 | 74.5 | |
| NV-ASRNV=cry, parameters=200M, architecture=RNN-Transducer, encoder=Emformer2026.07 | 83.7 | 73.6 | 78.3 | |
| Whisper-DNV=breath, parameters=1.55B, backbone=Whisper-v2-large2026.07 | 81.8 | 5.9 | 11 | |
| NV-ASRNV=laugh, parameters=200M, architecture=RNN-Transducer, encoder=Emformer2026.07 | 79.1 | 88.2 | 83.4 | |
| NV-ASRNV=breath, parameters=200M, architecture=RNN-Transducer, encoder=Emformer2026.07 | 75.1 | 70.8 | 72.9 | |
| NV-ASRNV=sigh, parameters=200M, architecture=RNN-Transducer, encoder=Emformer2026.07 | 73.6 | 75.4 | 74.5 | |
| NV-ASRNV=smack, parameters=200M, architecture=RNN-Transducer, encoder=Emformer2026.07 | 72.5 | 56.3 | 63.4 | |
| Whisper-DNV=laugh, parameters=1.55B, backbone=Whisper-v2-large2026.07 | 68.9 | 65.7 | 67.3 | |
| Whisper-DNV=smack, parameters=1.55B, backbone=Whisper-v2-large2026.07 | 66.7 | 2.9 | 5.6 | |
| Whisper-DNV=sigh, parameters=1.55B, backbone=Whisper-v2-large2026.07 | 42.5 | 44.8 | 43.6 |