Audio-Visual Question Answering on Music-AVQA 2000 samples
13.8ASR RateCombined Loss
Evaluation Results
| Method | Links | |
|---|---|---|
| Combined LossAttack Objective=L(combined), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 13.8 | |
| Encoder-Based Cosine Similarity LossAttack Objective=L(cos), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 12.92 | |
| Negative Language Modeling LossAttack Objective=L_negLM, Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 10.74 | |
| Hidden-State Similarity LossAttack Objective=L(hidden-cos), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 10.28 | |
| Audio Attention Amplification LossAttack Objective=L(audioatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 9.81 | |
| Attention Randomization LossAttack Objective=L(randatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 9.81 | |
| Vision Attention Suppression LossAttack Objective=L(visionatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 7.94 |