Visual Question Answering on VQA
82.18AccuracyLlaMA-3 MM trained
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LlaMA-3 MM trainedModel Version=Stage-1 SFT checkpoint2026.05 | 82.18 | — | — | — | — | |
| LlaMA-3 MM baseModel Version=Base2026.05 | 81.45 | — | — | — | — | |
| MetaMAEPretrain data=MSCOCO, Evaluation setup=Linear classification2023.10 | 69.7 | — | — | — | — | |
| OursModel=Qwen2.5-VL2026.04 | 69.07 | — | — | — | 64.03 | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-7B-VL, Train Set=VQA2026.03 | 68.2 | — | — | — | — | |
| Grid-SearchModel=Qwen2.5-VL2026.04 | 68.03 | — | — | — | 63.11 | |
| Ours w/o KLModel=Qwen2.5-VL2026.04 | 67.9 | — | — | — | 62.81 | |
| Fixed-AmpModel=Qwen2.5-VL2026.04 | 67.73 | — | — | — | 62.91 | |
| RandNeuronModel=Qwen2.5-VL2026.04 | 67.6 | — | — | — | 62.53 | |
| BaseModel=Qwen2.5-VL2026.04 | 67.5 | — | — | — | 62.59 | |
| OursModel=LLaVA-1.52026.04 | 67.33 | — | — | — | 59.46 | |
| Grid-SearchModel=LLaVA-1.52026.04 | 66.6 | — | — | — | 58.7 | |
| Fixed-AmpModel=LLaVA-1.52026.04 | 66.1 | — | — | — | 57.73 | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-7B-VL, Train Set=GQA2026.03 | 66 | — | — | — | — | |
| Ours w/o KLModel=LLaVA-1.52026.04 | 65.8 | — | — | — | 57.8 | |
| RandNeuronModel=LLaVA-1.52026.04 | 65.3 | — | — | — | 57.18 | |
| SFT (HQ Correct Only)Model=Qwen2.5-7B-VL, Train Set=VQA2026.03 | 65.2 | — | — | — | — | |
| BaseModel=LLaVA-1.52026.04 | 65.2 | — | — | — | 57.23 | |
| SFT (HQ Correct Only)Model=Qwen2.5-7B-VL, Train Set=GQA2026.03 | 64.85 | — | — | — | — | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-7B-VL, Train Set=VQA2026.03 | 64.8 | — | — | — | — | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-7B-VL, Train Set=GQA2026.03 | 63.9 | — | — | — | — | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-7B-VL, Train Set=HiTab2026.03 | 63.55 | — | — | — | — | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-7B-VL, Train Set=HiTab2026.03 | 62.65 | — | — | — | — | |
| VanillaBackbone=LLaVA-v1.5-13B2025.11 | 62.3 | — | — | — | — | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-3B-VL, Train Set=VQA2026.03 | 61.45 | — | — | — | — | |
| SFT (HQ Correct Only)Model=Qwen2.5-7B-VL, Train Set=HiTab2026.03 | 60.85 | — | — | — | — | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-3B-VL, Train Set=HiTab2026.03 | 60.85 | — | — | — | — | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-3B-VL, Train Set=HiTab2026.03 | 60.4 | — | — | — | — | |
| SINEPROJECT(PO+PD)Backbone=LLaVA-v1.5-13B2025.11 | 60.4 | — | — | — | — | |
| POBackbone=LLaVA-v1.5-13B2025.11 | 60.1 | — | — | — | — | |
| PO+PDBackbone=LLaVA-v1.5-13B2025.11 | 60.1 | — | — | — | — | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-3B-VL, Train Set=VQA2026.03 | 60.05 | — | — | — | — | |
| BaselineModel=Qwen2.5-7B-VL, Training=Inference Only2026.03 | 60 | — | — | — | — | |
| SFT (HQ Correct Only)Model=Qwen2.5-3B-VL, Train Set=HiTab2026.03 | 59.4 | — | — | — | — | |
| SFT (HQ Correct Only)Model=Qwen2.5-3B-VL, Train Set=VQA2026.03 | 59.3 | — | — | — | — | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-3B-VL, Train Set=GQA2026.03 | 58.7 | — | — | — | — | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-3B-VL, Train Set=GQA2026.03 | 58.7 | — | — | — | — | |
| KL+PDBackbone=LLaVA-v1.5-13B2025.11 | 58.6 | — | — | — | — | |
| POBackbone=LLaVA-v1.5-7B2025.11 | 57.9 | — | — | — | — | |
| VanillaBackbone=LLaVA-v1.5-7B2025.11 | 57.8 | — | — | — | — | |
| e-MixPretrain data=MSCOCO, Evaluation setup=Linear classification2023.10 | 57.6 | — | — | — | — | |
| SINEPROJECT(PO+PD)Backbone=LLaVA-v1.5-7B2025.11 | 57.6 | — | — | — | — | |
| PO+PDBackbone=LLaVA-v1.5-7B2025.11 | 57.4 | — | — | — | — | |
| SFT (HQ Correct Only)Model=Qwen2.5-3B-VL, Train Set=GQA2026.03 | 56.85 | — | — | — | — | |
| BaselineModel=Qwen2.5-3B-VL, Training=Inference Only2026.03 | 56.3 | — | — | — | — | |
| KL+PDBackbone=LLaVA-v1.5-7B2025.11 | 56.2 | — | — | — | — | |
| MAEPretrain data=MSCOCO, Evaluation setup=Linear classification2023.10 | 54.2 | — | — | — | — | |
| GD+PDBackbone=LLaVA-v1.5-13B2025.11 | 53.5 | — | — | — | — | |
| BaselinePretrain data=MSCOCO, Evaluation setup=Linear classification2023.10 | 53.4 | — | — | — | — | |
| ShEDPretrain data=MSCOCO, Evaluation setup=Linear classification2023.10 | 53.1 | — | — | — | — | |
| CapriPretrain data=MSCOCO, Evaluation setup=Linear classification2023.10 | 52.9 | — | — | — | — | |
| GD+PDBackbone=LLaVA-v1.5-7B2025.11 | 50.3 | — | — | — | — | |
| LLaVA-1.5Image Encoder=OpenAI CLIP ViT-L/14, Params=7B, LLM-as-Judge=GPT-4o2026.01 | 38 | — | — | — | — | |
| InstructBLIP (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B, LLM-as-Judge=GPT-4o2026.01 | 38 | — | — | — | — | |
| LLaVA-1.6Image Encoder=OpenAI CLIP ViT-L/14, Params=7B, LLM-as-Judge=GPT-4o2026.01 | 37 | — | — | — | — | |
| KLBackbone=LLaVA-v1.5-13B2025.11 | 30.3 | — | — | — | — | |
| KLBackbone=LLaVA-v1.5-7B2025.11 | 30.1 | — | — | — | — | |
| BLIP-2 (FlanT5XL ViT-L)Image Encoder=OpenAI CLIP ViT-L/14, Params=3.4B, LLM-as-Judge=GPT-4o2026.01 | 30 | — | — | — | — | |
| BLIP-2 (FlanT5XL)Image Encoder=EVA-CLIP ViT-G/14, Params=4.1B, LLM-as-Judge=GPT-4o2026.01 | 22 | — | — | — | — | |
| GA+PDBackbone=LLaVA-v1.5-7B2025.11 | 19.3 | — | — | — | — | |
| OpenFlamingoImage Encoder=OpenAI CLIP ViT-L/14, Params=3B, LLM-as-Judge=GPT-4o2026.01 | 14 | — | — | — | — | |
| GDBackbone=LLaVA-v1.5-7B2025.11 | 10.9 | — | — | — | — | |
| GDBackbone=LLaVA-v1.5-13B2025.11 | 10.1 | — | — | — | — | |
| GA+PDBackbone=LLaVA-v1.5-13B2025.11 | 4.8 | — | — | — | — | |
| GABackbone=LLaVA-v1.5-7B2025.11 | 0.4 | — | — | — | — | |
| GABackbone=LLaVA-v1.5-13B2025.11 | 0 | — | — | — | — | |
| +CSR defensedefense=CSR2026.01 | — | 98.7 | 65.6 | — | — | |
| +TTC defensedefense=TTC2026.01 | — | 87.7 | 27.3 | — | — | |
| Mem0 (Gemma2-27B)Backbone=Gemma2-27B, Captioning=BLIP-based2025.12 | — | — | — | 23.7 | — | |
| Mem0 (GPT-OSS-120B)Backbone=GPT-OSS-120B, Captioning=BLIP-based2025.12 | — | — | — | 22 | — | |
| Mem0 (InternVL3-1B)Backbone=InternVL3-1B2025.12 | — | — | — | 50 | — | |
| Mem0 (InternVL3-2B)Backbone=InternVL3-2B2025.12 | — | — | — | 70.8 | — | |
| MemLoRA-V (InternVL3-1B)Backbone=InternVL3-1B, KD teacher=Gemma2-27B\InternVL3-78B2025.12 | — | — | — | 69.4 | — | |
| MemLoRA-V (InternVL3-2B)Backbone=InternVL3-2B, KD teacher=Gemma2-27B\InternVL3-78B2025.12 | — | — | — | 81.3 | — | |
| Origin Modeldefense=None2026.01 | — | 100 | 22.6 | — | — |