Audio-Visual Question Answering on MUSIC-AVQA (Modality Combination Breakdown)
54.68Accuracy (V+A+L)SSAM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SSAMTraining protocol=Training-free model merging methods2026.03 | 54.68 | 54.34 | 54.55 | 56.3 | 54.97 | |
| WUDITraining protocol=Training-free model merging methods2026.03 | 54.1 | 53.89 | 53.78 | 52.43 | 53.55 | |
| TSVTraining protocol=Training-free model merging methods2026.03 | 53.63 | 53.81 | 54.26 | 54.73 | 54.11 | |
| Task ArithmeticTraining protocol=Training-free model merging methods2026.03 | 53.62 | 53.53 | 53.22 | 55.98 | 54.09 | |
| OptMergeTraining protocol=Training-free model merging methods2026.03 | 51.05 | 51.83 | 52.17 | 53.17 | 52.06 | |
| DAMCTraining protocol=Training-free model merging methods2026.03 | 50.91 | 49.09 | 53.08 | 57.32 | 52.6 | |
| NaiveMCTraining protocol=Training-free model merging methods2026.03 | 50.66 | 49 | 52.52 | 53.63 | 51.45 | |
| X-InstructBLIPTraining protocol=Models finetuned on paired multimodal data2026.03 | 48.34 | 45.83 | 41.23 | 47.39 | 45.7 | |
| OneLLM-7BTraining protocol=Models finetuned on paired multimodal data2026.03 | 47.6 | — | — | — | 47.6 | |
| Proj-OnlyTraining protocol=Models finetuned on paired multimodal data2026.03 | 46.17 | 44.93 | 46.64 | 50.21 | 46.99 | |
| ChatBridge-13BTraining protocol=Models finetuned on paired multimodal data2026.03 | 43 | — | — | — | 43 | |
| ImageBind-LLMTraining protocol=Models finetuned on paired multimodal data2026.03 | 39.72 | 37.24 | 38.76 | 38.16 | 38.47 |