Audio temporal grounding on UnAV-100 subset
88R1@.3SpotSound-Q
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SpotSound-QModel Category=Open-Source Models, Integration Backbone=Qwen2 Audio2026.04 | 88 | 74 | 72.4 | |
| SpotSound-AModel Category=Open-Source Models, Integration Backbone=Audio Flamingo 32026.04 | 86 | 74 | 69.8 | |
| AM-DETRModel Category=Non-LLM Models2026.04 | 59 | 46 | 42.8 | |
| WTATGModel Category=Non-LLM Models2026.04 | 53 | 37 | 38.4 | |
| Gemini-2.5-FlashModel Category=Proprietary Models2026.04 | 48 | 37 | 35.6 | |
| Gemini-2.5-ProModel Category=Proprietary Models2026.04 | 39 | 35 | 34.6 | |
| Audio Flamingo 3Model Category=Open-Source Models2026.04 | 35 | 24 | 25 | |
| TimeAudioModel Category=Open-Source Models2026.04 | 21 | 7 | 16 | |
| Qwen2-AudioModel Category=Open-Source Models2026.04 | 14 | 4 | 9.7 | |
| Kimi-AudioModel Category=Open-Source Models2026.04 | 8 | 2 | 5.3 |