Audio-Visual Question Answering on AVQA (subset 2000 samples)
96.03ASR AccuracyCombined Loss
Evaluation Results
| Method | Links | |
|---|---|---|
| Combined LossAttack Objective=L(combined), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 96.03 | |
| Encoder-Based Cosine Similarity LossAttack Objective=L(cos), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 89.12 | |
| Audio Attention Amplification LossAttack Objective=L(audioatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 56.21 | |
| Vision Attention Suppression LossAttack Objective=L(visionatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 18.72 | |
| Attention Randomization LossAttack Objective=L(randatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 17.24 | |
| Hidden-State Similarity LossAttack Objective=L(hidden-cos), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 15.13 | |
| Negative Language Modeling LossAttack Objective=L_negLM, Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 10.27 |