Generalized Zero-Shot Retrieval (Text-to-Audio) on AudioSet ZSL (test)
72.25mAP (S)AVGZSLNet
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AVGZSLNetTest Direction=Text to Audio-Video, fusion=equal weight2020.05 | 72.25 | 6.91 | 12.61 | |
| AVGZSLNetTest Direction=Text to Audio-Video, fusion=with attention2020.05 | 68.94 | 7.08 | 12.84 | |
| CJMETest Direction=Text to Audio-Video, fusion=equal weight2020.05 | 65.45 | 5.4 | 9.97 | |
| CJMETest Direction=Text to Audio-Video, fusion=with attention2020.05 | 62.97 | 5.67 | 10.41 | |
| AVGZSLNetTest Direction=Text to Video2020.05 | 62.2 | 6.39 | 11.6 | |
| CJMETest Direction=Text to Video2020.05 | 59.39 | 5.55 | 10.15 | |
| GCCATest Direction=Text to Video2020.05 | 57.67 | 3.54 | 6.67 | |
| AVGZSLNetTest=T -> A2020.05 | 51.55 | 3.85 | 7.17 | |
| AVGZSLNetTest Direction=Text to Audio2020.05 | 51.55 | 3.85 | 7.17 | |
| GCCATest=T -> A2020.05 | 49.84 | 2.39 | 4.56 | |
| GCCATest Direction=Text to Audio2020.05 | 49.84 | 2.39 | 4.56 | |
| video only modelTest Direction=Text to Video2020.05 | 48.62 | 5.25 | 9.47 | |
| CJMETest=T -> A2020.05 | 48.24 | 3.32 | 6.21 | |
| CJMETest Direction=Text to Audio2020.05 | 48.24 | 3.32 | 6.21 | |
| audio only modelTest=T -> A2020.05 | 43.16 | 3.34 | 6.2 | |
| audio only modelTest Direction=Text to Audio2020.05 | 43.16 | 3.34 | 6.2 | |
| pre-trained modelTest=T -> A2020.05 | 3.83 | 1.66 | 2.32 | |
| pre-trained modelTest Direction=Text to Audio2020.05 | 3.83 | 1.66 | 2.32 | |
| pre-trained modelTest Direction=Text to Video2020.05 | 3.83 | 2.53 | 3.05 |