Audio-Visual Question Answering on AVQA
94.2AccuracyV-LynX-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| V-LynX-7BEvaluation Protocol=Task-specific, Model Scale=≥ 7B, ∆Params.=195.0M2026.05 | 94.2 | |
| Qwen3-OmniReasoning=true, Model Size=30B, Zero-shot=true2026.04 | 93.8 | |
| PAVE-7BEvaluation Protocol=Task-specific, Model Scale=≥ 7B, ∆Params.=256.7M2026.05 | 93.8 | |
| V-LynX-0.5BEvaluation Protocol=Task-specific, Model Scale=< 7B, ∆Params.=68.7M2026.05 | 93.1 | |
| Crab+2026.03 | 92.16 | |
| CAT-7BEvaluation Protocol=fine-tuned2024.03 | 92 | |
| CAT-7B-FTEvaluation Protocol=Task-specific, Model Scale=≥ 7B2026.05 | 92 | |
| AVRTReasoning=true, Model Size=3B, In-domain=true2026.04 | 91.1 | |
| LLaVA-OV-7B-FTEvaluation Protocol=Task-specific, Model Scale=≥ 7B, ∆Params.=161.5M2026.05 | 90.8 | |
| AVRTReasoning=true, Model Size=7B, In-domain=true2026.04 | 90.4 | |
| PAVE-0.5BEvaluation Protocol=Task-specific, Model Scale=< 7B, ∆Params.=127.6M2026.05 | 90.4 | |
| PSTP-NetEvaluation Protocol=fine-tuned2024.03 | 90.2 | |
| PSTP-Net2026.03 | 90.2 | |
| PSTP-NetEvaluation Protocol=Task-specific, Model Scale=< 7B2026.05 | 90.2 | |
| SaSR-Net2026.03 | 89.9 | |
| EgoAVU (LoRA)Fine-tuning Strategy=LoRA2026.02 | 89.7 | |
| EgoAVU (Full)Fine-tuning Strategy=Full2026.02 | 89.5 | |
| Qwen2.5-Omni2026.02 | 89.4 | |
| HCRN + HAVFEvaluation Protocol=fine-tuned2024.03 | 89 | |
| HCRN+HAVF2026.03 | 89 | |
| Qwen2.5 OmniReasoning=false, Model Size=3B, Zero-shot=true2026.04 | 88.3 | |
| HGA + HAVFEvaluation Protocol=fine-tuned2024.03 | 87.7 | |
| Full TokenBackbone=Qwen2.5-Omni 7B, Comp.↑ (%)=02026.05 | 87.6 | |
| Full TokenBackbone=Qwen2.5-Omni 3B, Comp.↑ (%)=02026.05 | 87.6 | |
| ContextGuardBackbone=Qwen2.5-Omni 3B, Comp.↑ (%)=612026.05 | 87.3 | |
| OmniZipBackbone=Qwen2.5-Omni 3B, Comp.↑ (%)=542026.05 | 87.3 | |
| FastVBackbone=Qwen2.5-Omni 3B, Comp.↑ (%)=502026.05 | 87.2 | |
| ContextGuardBackbone=Qwen2.5-Omni 7B, Comp.↑ (%)=552026.05 | 87.1 | |
| RandomBackbone=Qwen2.5-Omni 3B, Comp.↑ (%)=502026.05 | 87.1 | |
| FastVBackbone=Qwen2.5-Omni 7B, Comp.↑ (%)=502026.05 | 87 | |
| OmniZipBackbone=Qwen2.5-Omni 7B, Comp.↑ (%)=542026.05 | 87 | |
| RandomBackbone=Qwen2.5-Omni 7B, Comp.↑ (%)=502026.05 | 86.7 | |
| V-RTSReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 86.6 | |
| LLaVA-OV-0.5B-FTEvaluation Protocol=Task-specific, Model Scale=< 7B, ∆Params.=35.2M2026.05 | 86.4 | |
| LLaVA-OV-7BEvaluation Protocol=Zero-shot2026.05 | 85.6 | |
| Qwen2.5 OmniReasoning=false, Model Size=7B, Zero-shot=true2026.04 | 84.9 | |
| v-SALMONN-o1Reasoning=true, Model Size=7B, Zero-shot=true2026.04 | 84.8 | |
| Full TokenBackbone=Video-SALMONN2+ 3B, Comp.↑ (%)=02026.05 | 81.6 | |
| ContextGuardBackbone=Video-SALMONN2+ 3B, Comp.↑ (%)=562026.05 | 81.4 | |
| Kimi-VL-ThinkingReasoning=true, Model Size=Teacher, Zero-shot=true2026.04 | 81.4 | |
| OmniZipBackbone=Video-SALMONN2+ 3B, Comp.↑ (%)=492026.05 | 81.3 | |
| RandomBackbone=Video-SALMONN2+ 3B, Comp.↑ (%)=502026.05 | 81.2 | |
| FastVBackbone=Video-SALMONN2+ 3B, Comp.↑ (%)=502026.05 | 81 | |
| TSV MergingEvaluation Protocol=Zero-shot, Composition Strategy=TSV Merging2025.05 | 80.9 | |
| OptMergeEvaluation Protocol=Zero-shot, Composition Strategy=OptMerge2025.05 | 80.82 | |
| DAMCEvaluation Protocol=Zero-shot, Composition Strategy=DAMC2025.05 | 80.78 | |
| NaiveMCEvaluation Protocol=Zero-shot, Composition Strategy=NaiveMC2025.05 | 80.26 | |
| VideoEvaluation Protocol=Zero-shot, Input Modality=Video2025.05 | 79.2 | |
| Crab2025.03 | 78.94 | |
| VALOR2025.03 | 78.9 | |
| Task ArithmeticEvaluation Protocol=Zero-shot, Composition Strategy=Task Arithmetic2025.05 | 78.62 | |
| Iso-CEvaluation Protocol=Zero-shot, Composition Strategy=Iso-C2025.05 | 77.51 | |
| LLaVA-OV-0.5BEvaluation Protocol=Zero-shot2026.05 | 77.4 | |
| WUDI MergingEvaluation Protocol=Zero-shot, Composition Strategy=WUDI Merging2025.05 | 76.86 | |
| Ties MergingEvaluation Protocol=Zero-shot, Composition Strategy=Ties Merging2025.05 | 75.84 | |
| VisionEvaluation Protocol=Zero-shot, Input Modality=Vision2025.05 | 75.55 | |
| Dynamic FSQ (Pure Semantic)Approx. Rate=5.0Hz, Backbone=LLaMA 3.1 8B, Acoustic reconstruction probe loss (L_Recon)=false2026.05 | 72.46 | |
| TAPFDataset=AudioSet, Quantizer=RVQ8, Frame Rate=50, Token Rate=4002026.04 | 72.08 | |
| Dynamic FSQ (w/ Recon)Approx. Rate=5.0Hz, Backbone=LLaMA 3.1 8B, Acoustic reconstruction probe loss (L_Recon)=included2026.05 | 71.39 | |
| Dynamic FSQApprox. Rate=6.0Hz, Backbone=LLaMA 3.1 8B2026.05 | 70.15 | |
| A-V Static FusionDataset=AudioSet, Quantizer=RVQ8, Frame Rate=50, Token Rate=4002026.04 | 69.52 | |
| TAPFDataset=AudioSet, Quantizer=FSQ, Frame Rate=50, Token Rate=502026.04 | 69.41 | |
| Weight AverageEvaluation Protocol=Zero-shot, Composition Strategy=Weight Average2025.05 | 69.39 | |
| OmniZipBackbone=Video-SALMONN2+ 7B, Comp.↑ (%)=492026.05 | 68.8 | |
| Full TokenBackbone=Video-SALMONN2+ 7B, Comp.↑ (%)=02026.05 | 67.8 | |
| WavTokenizerDataset=Several, Quantizer=VQ, Frame Rate=75, Token Rate=752026.04 | 67.34 | |
| WavTokenizerApprox. Rate=40/75Hz, Backbone=LLaMA 3.1 8B2026.05 | 67.32 | |
| ContextGuardBackbone=Video-SALMONN2+ 7B, Comp.↑ (%)=552026.05 | 66.9 | |
| RandomBackbone=Video-SALMONN2+ 7B, Comp.↑ (%)=502026.05 | 66.8 | |
| FastVBackbone=Video-SALMONN2+ 7B, Comp.↑ (%)=502026.05 | 66.1 | |
| DAC TokenizerDataset=Several, Quantizer=RVQ9, Frame Rate=31.25, Token Rate=2812026.04 | 65.61 | |
| DAC TokenizerApprox. Rate=75-100Hz, Backbone=LLaMA 3.1 8B2026.05 | 65.61 | |
| Dynamic FSQApprox. Rate=4.0Hz, Backbone=LLaMA 3.1 8B2026.05 | 65.26 | |
| AF3 (think)Reasoning=true, Model Size=Teacher, Zero-shot=true2026.04 | 64.3 | |
| VideoLLaMA2 w/ FastAVFLOPs=56, Latency=0.32, Memory=19G2026.01 | 62.3 | |
| VideoLLaMA2FLOPs=100, Latency=0.43, Memory=22G2026.01 | 61.4 | |
| video-SALMONN2 w/ FastAVFLOPs=58, Latency=0.29, Memory=21G2026.01 | 58.4 | |
| Speech TokenizerDataset=LibriSpeech, Quantizer=RVQ8, Frame Rate=50, Token Rate=4002026.04 | 58.39 | |
| Speech TokenizerApprox. Rate=50Hz, Backbone=LLaMA 3.1 8B2026.05 | 58.39 | |
| A-V Static FusionDataset=AudioSet, Quantizer=FSQ, Frame Rate=50, Token Rate=502026.04 | 58.32 | |
| Fixed-Stride FSQApprox. Rate=~5.5Hz, Backbone=LLaMA 3.1 8B2026.05 | 57.77 | |
| video-SALMONN2FLOPs=100, Latency=0.44, Memory=28G2026.01 | 57.6 | |
| SYLLABLELMApprox. Rate=~4-5Hz, Backbone=LLaMA 3.1 8B2026.05 | 55.26 | |
| AudioEvaluation Protocol=Zero-shot, Input Modality=Audio2025.05 | 47.57 | |
| X-InstructBLIPzero-shot=true2025.03 | 44.5 |