Personal Voice Activity Detection on LibriSpeech 3 Speakers Segment 1 500-hour simulation (test)
87.85AccuracyAdaptive Speaker Embedding Self-Augmentation (Additive Fusion)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Adaptive Speaker Embedding Self-Augmentation (Additive Fusion)Enrollment Length=1.5s, Augment Embed=true, Embed Source=Augmented add2026.01 | 87.85 | 81.71 | 88.19 | 86.87 | 91.63 | 96.64 | 92.78 | |
| Adaptive Speaker Embedding Self-Augmentation (Concat Fusion)Enrollment Length=1.5s, Augment Embed=true, Embed Source=Augmented cat2026.01 | 87.23 | 80.37 | 87.59 | 86.22 | 91.61 | 96.48 | 92.27 | |
| PVAD2.0 (Selected Source)Enrollment Length=1.5s, Augment Embed=false, Embed Source=Selected2026.01 | 87.14 | 79.84 | 87.38 | 86.12 | 91.91 | 96.05 | 91.05 | |
| Adaptive Speaker Embedding Self-Augmentation (Additive Fusion)Enrollment Length=1s, Augment Embed=true, Embed Source=Augmented add2026.01 | 87.14 | 80.09 | 87.15 | 86.16 | 91.61 | 96.19 | 91.73 | |
| PVAD2.0 (Selected Source)Enrollment Length=1s, Augment Embed=false, Embed Source=Selected2026.01 | 86.52 | 78.51 | 86.28 | 85.51 | 91.91 | 95.43 | 89.5 | |
| Adaptive Speaker Embedding Self-Augmentation (Concat Fusion)Enrollment Length=1s, Augment Embed=true, Embed Source=Augmented cat2026.01 | 86.28 | 77.98 | 86.35 | 85.25 | 91.58 | 95.7 | 90.5 | |
| PVAD2.0 (Enroll Source)Enrollment Length=1.5s, Augment Embed=false, Embed Source=Enroll2026.01 | 86.26 | 74.85 | 86.54 | 85.22 | 92.74 | 95.4 | 89.41 | |
| Adaptive Speaker Embedding Self-Augmentation (Additive Fusion)Enrollment Length=0.5s, Augment Embed=true, Embed Source=Augmented add2026.01 | 85.34 | 75.34 | 84.68 | 84.3 | 91.54 | 94.83 | 88.39 | |
| PVAD2.0 (Selected Source)Enrollment Length=0.5s, Augment Embed=false, Embed Source=Selected2026.01 | 84.88 | 75.78 | 82.67 | 83.92 | 91.96 | 93.56 | 85.08 | |
| PVAD2.0 (Enroll Source)Enrollment Length=1s, Augment Embed=false, Embed Source=Enroll2026.01 | 84.74 | 71.26 | 83.96 | 83.66 | 92.72 | 94.18 | 86.37 | |
| Adaptive Speaker Embedding Self-Augmentation (Concat Fusion)Enrollment Length=0.5s, Augment Embed=true, Embed Source=Augmented cat2026.01 | 84.03 | 72.89 | 82.68 | 82.94 | 91.4 | 94.22 | 86.55 | |
| PVAD2.0 (Enroll Source)Enrollment Length=0.5s, Augment Embed=false, Embed Source=Enroll2026.01 | 81.56 | 63 | 78.9 | 80.28 | 92.46 | 91.3 | 78.98 |