Text-to-sound generation on AudioCaps (test)
9.76FIDDiffsound
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DiffsoundCodebook=AudioSet, Text Encoder=CLIP2022.07 | 9.76 | 4.21 | 0.103 | 0.36 | |
| DiffsoundCodebook=AudioCaps, Text Encoder=CLIP2022.07 | 13.47 | 4.95 | 0.093 | 0.28 | |
| ARCodebook=AudioSet, Text Encoder=CLIP2022.07 | 16.87 | 5.31 | 0.088 | 0.22 | |
| ARCodebook=AudioCaps, Text Encoder=CLIP2022.07 | 17.94 | 5.98 | 0.082 | 0.2 | |
| ARCodebook=AudioCaps, Text Encoder=BERT2022.07 | 18.01 | 6.8 | 0.055 | 0.1 |