Speaker Verification on TidyVoice 2026 (dev)
0.893EER (%)w2v-BERT 2.0 Based_SF2-C ++ QMF
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| w2v-BERT 2.0 Based_SF2-C ++ QMFPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=TidyVoiceX Train2026.03 | 0.893 | 0.6 | |
| w2v-BERT 2.0 Based_SF2-C + GRLPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=TidyVoiceX Train2026.03 | 0.937 | 0.6 | |
| w2v-BERT 2.0 Based_SF2-CPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=TidyVoiceX Train2026.03 | 0.95 | 0.61 | |
| w2v-BERT 2.0 Based_SF2-CPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=TidyVoiceX Train + Sub Synthetic Data2026.03 | 0.954 | 0.61 | |
| w2v-BERT 2.0 Based_SF2-APretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=TidyVoiceX Train2026.03 | 0.966 | 0.61 | |
| w2v-BERT 2.0 Based_SF2-CPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=TidyVoiceX Train + All Synthetic Data2026.03 | 0.999 | 0.61 | |
| w2v-BERT 2.0 Based_SF2-CPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=All Synthetic Data2026.03 | 1.022 | 0.6 | |
| w2v-BERT 2.0 Based_SF2-CPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=Pretraining Data + TidyVoiceX Train2026.03 | 1.065 | 0.62 | |
| w2v-BERT 2.0 Based_SF2-APretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=Pretraining Data + TidyVoiceX Train2026.03 | 1.089 | 0.63 | |
| w2v-BERT 2.0 BasedPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=TidyVoiceX Train2026.03 | 1.191 | 0.63 | |
| w2v-BERT 2.0 BasedPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=Pretraining Data + TidyVoiceX Train2026.03 | 1.466 | 0.66 | |
| w2v-BERT 2.0 BasedPretraining Data=VoxBlink2 + VoxCeleb2 + 3D-Speaker + KeSpeech + CnCeleb1&2, Fine-tuning Data=None2026.03 | 2.74 | 0.79 | |
| Official BaselinePretraining Data=VoxBlink2 + VoxCeleb2, Fine-tuning Data=TidyVoiceX Train2026.03 | 3.07 | 0.82 |