Audio-Visual Scene-aware Dialog on AVSD (val)
59.48ASR (%)Combined Loss
Evaluation Results
| Method | Links | |
|---|---|---|
| Combined LossAttack Objective=L(combined), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 59.48 | |
| Encoder-Based Cosine Similarity LossAttack Objective=L(cos), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 57.03 | |
| Negative Language Modeling LossAttack Objective=L_negLM, Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 50.43 | |
| Vision Attention Suppression LossAttack Objective=L(visionatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 49.34 | |
| Attention Randomization LossAttack Objective=L(randatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 45.67 | |
| Audio Attention Amplification LossAttack Objective=L(audioatt), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 43.85 | |
| Hidden-State Similarity LossAttack Objective=L(hidden-cos), Source Model=VideoLLAMA2, Training Dataset=AVQA, Training Epochs=1502026.01 | 41.53 |