Vocal Event Detection on WESR-Bench 1.0 (test)
44.8PrecisionWESR-Kimi
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| WESR-KimiEvaluation Protocol=Fine-tuned, Base Model=Kimi-Audio2026.01 | 44.8 | 38.9 | 37.8 | |
| WESR-WhisperEvaluation Protocol=Fine-tuned, Base Model=Whisper2026.01 | 44.7 | 40.2 | 37.7 | |
| WESR-QwenEvaluation Protocol=Fine-tuned, Base Model=Qwen3-Omni2026.01 | 40.9 | 41.6 | 38 | |
| Gemini-2.5-ProEvaluation Protocol=2-shot prompting2026.01 | 34.4 | 33.5 | 29.9 | |
| Gemini-3-ProEvaluation Protocol=2-shot prompting2026.01 | 34.2 | 35.1 | 32.3 | |
| Qwen3-OmniEvaluation Protocol=2-shot prompting2026.01 | 23.6 | 17.2 | 16.9 | |
| Kimi-AudioEvaluation Protocol=2-shot prompting2026.01 | 14.1 | 12.3 | 10.3 |