Multi-image visual perception on BLINK
62.8AccuracyQwen3-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VLSize=8B, Configuration=Baseline2026.04 | 62.8 | |
| MODIXSize=8B, Backbone=Qwen3-VL2026.04 | 61.05 | |
| Defender Iter. 3Training Strategy=Iterative Co-evolution2026.01 | 55.92 | |
| Qwen3-VL-2B# Total Params=2.1B, Evaluation Toolkit=VLMEvalKit2025.11 | 54.87 | |
| MODIXSize=8B, Backbone=InternVL3.52026.04 | 54.79 | |
| Defender Iter. 2Training Strategy=Iterative Co-evolution2026.01 | 54.76 | |
| Ablation (Clean Data)Training Strategy=Ablation2026.01 | 54.55 | |
| Defender Iter. 1Training Strategy=Iterative Co-evolution2026.01 | 54.55 | |
| Liu et al. (Add)Training Strategy=Finite Augmentation Datasets2026.01 | 54.28 | |
| Yang et al.Training Strategy=Finite Augmentation Datasets2026.01 | 54.13 | |
| Base (M_def^(0))Training Strategy=Base2026.01 | 54.08 | |
| Liu et al. (Insert)Training Strategy=Finite Augmentation Datasets2026.01 | 54.02 | |
| Liu et al. (All)Training Strategy=Finite Augmentation Datasets2026.01 | 53.5 | |
| InternVL3.5Size=8B, Configuration=Baseline2026.04 | 53.5 | |
| MODIXSize=2B, Backbone=InternVL3.52026.04 | 51.97 | |
| MODIXSize=2B, Backbone=Qwen3-VL2026.04 | 51.22 | |
| MODIXSize=3B, Backbone=LFM2-VL2026.04 | 51.08 | |
| LFM2-VL-3B# Total Params=3.0B, Evaluation Toolkit=VLMEvalKit2025.11 | 51.03 | |
| InternVL3.5-2B# Total Params=2.3B, Evaluation Toolkit=VLMEvalKit2025.11 | 50.97 | |
| InternVL3.5Size=2B, Configuration=Baseline2026.04 | 49.76 | |
| Qwen3-VLSize=2B, Configuration=Baseline2026.04 | 49.18 | |
| Qwen2.5-VL-3B# Total Params=3.75B, Evaluation Toolkit=VLMEvalKit2025.11 | 48.97 | |
| LFM2-VLSize=3B, Configuration=Baseline2026.04 | 47.56 | |
| MODIXSize=1.6B, Backbone=LFM2-VL2026.04 | 45.08 | |
| SmolVLM2-2.2B# Total Params=2.2B, Evaluation Toolkit=VLMEvalKit2025.11 | 42.3 | |
| LFM2-VLSize=1.6B, Configuration=Baseline2026.04 | 41.68 |