Image-to-sound generation on ImageHear
3.425FidelityV2A-Mapper
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| V2A-MapperCLIP backbone=ViT-B/32, Audio generator=AudioLDM2023.08 | 3.425 | 3.31 | — | |
| CLIPSonic-IQ2023.08 | 2.888 | 3.215 | — | |
| Im2Wav2023.08 | 1.84 | 2.705 | — | |
| CLIPSonic-IQInference Time (s)=53.94, #Trainable Param. (M)=142.582023.08 | — | — | 11.392 | |
| Im2WavInference Time (s)=864.12, #Trainable Param. (M)=360.42023.08 | — | — | 9.843 | |
| V2A-MapperInference Time (s)=35.45, #Trainable Param. (M)=48.832023.08 | — | — | 11.95 |