Visual Question Answering on IconQA
87.2Top-1 AccFR-Merging
Evaluation Results
| Method | Links | |
|---|---|---|
| FR-MergingEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 87.2 | |
| EMR-MergingEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 84 | |
| RobustMergeEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 82.3 | |
| Qwen2.5-VL-3BTraining Stage=SCALe-GRPO2026.03 | 75.58 | |
| Qwen2.5-VL-3BTraining Stage=GRPO2026.03 | 74.26 | |
| Qwen2.5-VL-3BTraining Stage=SCALe-SFT2026.03 | 71.91 | |
| Qwen2.5-VL-3BTraining Stage=SFT2026.03 | 71.38 | |
| TARA-Variant BBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-based2026.03 | 69.5 | |
| TARA-Variant ABackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-based2026.03 | 69.2 | |
| LLaVA-v1.6-Mistral-7BTraining Stage=SCALe-GRPO2026.03 | 69.17 | |
| Qwen2.5-VL-3BTraining Stage=Base2026.03 | 69.04 | |
| AdaMergingEvaluation Protocol=Merged, Token Strategy=Full Token, Backbone=Vicuna 7B, LoRA rank=162026.03 | 68.7 | |
| LLaVA-v1.6-Mistral-7BTraining Stage=SCALe-SFT2026.03 | 68.25 | |
| LLaVA-v1.6-Mistral-7BTraining Stage=GRPO2026.03 | 68.21 | |
| Gemma-3-4bTraining Stage=SCALe-GRPO2026.03 | 67.8 | |
| FinetunedEvaluation Protocol=Finetuned, Backbone=Vicuna 7B, LoRA rank=162026.03 | 67.8 | |
| LLaVA-v1.6-Mistral-7BTraining Stage=SFT2026.03 | 67.47 | |
| TIESBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-free2026.03 | 66.5 | |
| AdaMergingBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-based2026.03 | 66.3 | |
| Gemma-3-4bTraining Stage=SCALe-SFT2026.03 | 65.83 | |
| FinetunedBackbone=LLaVA, Adapter Rank=162026.03 | 65.2 | |
| Gemma-3-4bTraining Stage=SFT2026.03 | 64.8 | |
| AdaMergingEvaluation Protocol=Merged, Token Strategy=Single Token, Backbone=Vicuna 7B, LoRA rank=162026.03 | 64.7 | |
| Gemma-3-4bTraining Stage=GRPO2026.03 | 64.33 | |
| TIESEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 61.2 | |
| KnOTS-TIESBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-free2026.03 | 60.5 | |
| NSCEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 59.7 | |
| DARE-TIESEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 57.4 | |
| TABackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-free2026.03 | 57.2 | |
| TAEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 56.8 | |
| SVDEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 56.2 | |
| LION-4Bparameters=4B2023.11 | 54.91 | |
| LION-12Bparameters=12B2023.11 | 54.89 | |
| InstructBLIP (T5XXL)backbone=T5XXL2023.11 | 53.18 | |
| LoRA-LEGOEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 53.1 | |
| LinearEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 52.6 | |
| InstructBLIP (T5XL)backbone=T5XL2023.11 | 52.47 | |
| KnOTS-DARE-TIESEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 52.4 | |
| InstructBLIPzero-shot=true, backbone=FlanT5-XXL2023.05 | 51.2 | |
| InstructBLIP+ (T5XXL)backbone=T5XXL, uses_in-house_data=true2023.11 | 51.2 | |
| InstructBLIPzero-shot=true, backbone=FlanT5-XL2023.05 | 50 | |
| InstructBLIP+ (T5XL)backbone=T5XL, uses_in-house_data=true2023.11 | 50 | |
| KnOTS-TIESEvaluation Protocol=Merged, Backbone=Vicuna 7B, LoRA rank=162026.03 | 49.8 | |
| Pink2023.11 | 47.8 | |
| MiniGPTV22023.11 | 47.7 | |
| BLIP-2zero-shot=true, backbone=FlanT5-XL2023.05 | 45.5 | |
| BLIP-2zero-shot=true, backbone=FlanT5-XXL2023.05 | 45.4 | |
| BLIVA2023.11 | 44.88 | |
| InstructBLIPzero-shot=true, backbone=Vicuna-13B2023.05 | 44.8 | |
| InstructBLIPzero-shot=true, backbone=Vicuna-7B2023.05 | 43.1 | |
| LLaVA2023.11 | 43 | |
| BLIP-2zero-shot=true, backbone=Vicuna-13B2023.05 | 40.6 | |
| BLIP-2zero-shot=true, backbone=Vicuna-7B2023.05 | 39.7 | |
| MiniGPT42023.11 | 37.6 | |
| LLaVA-v1.6-Mistral-7BTraining Stage=Base2026.03 | 37.39 | |
| Gemma-3-4bTraining Stage=Base2026.03 | 36.73 | |
| Zero-ShotEvaluation Protocol=Zero-Shot2026.03 | 17.9 |