Impact sound synthesis on Greatest Hits (test)
2.04KL Div.Video + Physics Diffusion
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Video + Physics DiffusionConditioning=Physics2023.03 | 2.04 | 26.2 | 0.01 | 0.008 | 0.7409 | — | — | — | |
| Physics-Driven Diffusion ModelConditioning=Physics Priors, Model Type=Diffusion2023.03 | 2.04 | — | — | — | — | 0.149 | — | — | |
| Video + Class label DiffusionConditioning=Class label2023.03 | 2.38 | 31.82 | 0.026 | 0.021 | 0.7202 | — | — | — | |
| Video + Spec DiffusionConditioning=Spectrogram2023.03 | 2.55 | 28.77 | 0.016 | 0.009 | 0.7046 | — | — | — | |
| Video Diffusion2023.03 | 2.77 | 54.57 | 0.054 | 0.014 | 0.6994 | — | — | — | |
| Video + MFCC DiffusionConditioning=MFCC2023.03 | 2.84 | 40.21 | 0.037 | 0.01 | 0.6787 | — | — | — | |
| Transformer-based2023.03 | 3.13 | 34.35 | 0.036 | 0.015 | 0.6286 | — | — | — | |
| ConvNet-based2023.03 | 4.65 | 43.5 | 0.053 | 0.013 | 0.5169 | — | — | — | |
| NN via Predicted Sound FeaturesArchitecture=LSTM, Predicted Features=Cochleagrams2023.03 | 7.39 | — | — | — | — | 0.205 | — | — | |
| NN via Visual FeaturesBackbone=ResNet-50, Physics Priors=false, Diffusion Model=false2023.03 | 10.6 | — | — | — | — | 0.307 | — | — | |
| ConvNet-based2023.03 | — | — | — | — | — | — | 18 | 17.6 | |
| Physics-Driven Diffusion Model2023.03 | — | — | — | — | — | — | 55.4 | 53.6 | |
| Transformer-based2023.03 | — | — | — | — | — | — | 26.6 | 28.8 |