Audio tagging on AudioSet 1.0 (evaluation)
43.1mAPCNN14
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CNN14Input=Log mel spectrogram, Sampling rate=32 kHz, Iterations=600k2019.12 | 43.1 | 97.3 | 2.732 | |
| DeepResInput=Raw waveforms2019.12 | 39.2 | 97.1 | 2.682 | |
| Large feature-level attentionFeatures=AudioSet embeddings [1]2019.12 | 36.9 | 96.9 | 2.64 | |
| TAL NetFeatures=AudioSet embeddings [1]2019.12 | 36.2 | 96.5 | 2.554 | |
| Multi-level attentionFeatures=AudioSet embeddings [1]2019.12 | 36 | 97 | 2.66 | |
| Single-level attentionFeatures=AudioSet embeddings [1]2019.12 | 33.7 | 96.8 | 2.612 | |
| Google CNNFeatures=AudioSet embeddings [13]2019.12 | 31.4 | 95.9 | 2.452 | |
| Random guessdescription=baseline2019.12 | 0.5 | 50 | 0 |