Multi-Image Visual Reasoning on MIMIC
0.755Common AccuracyOurs (masked)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Ours (masked)Backbone=7B, masked-attention=true2026.01 | 0.755 | 0.512 | 0.721 | 0.55 | 0.638 | |
| LLaVA-OV-7BBackbone=7B2026.01 | 0.715 | 0.297 | 0.581 | 0.566 | 0.54 | |
| Ours (masked)Backbone=0.5B, masked-attention=true2026.01 | 0.689 | 0.358 | 0.509 | 0.42 | 0.494 | |
| OursBackbone=0.5B, masked-attention=false2026.01 | 0.685 | 0.378 | 0.41 | 0.345 | 0.455 | |
| Qwen2VL-7B2026.01 | 0.586 | 0.357 | 0.359 | 0.234 | 0.384 | |
| InternVL2-8B2026.01 | 0.452 | 0.189 | 0.302 | 0.298 | 0.31 | |
| LLaVA-OV-0.5BBackbone=0.5B2026.01 | 0.447 | 0.297 | 0.083 | 0.228 | 0.264 | |
| Qwen2VL-2B2026.01 | 0.419 | 0.217 | 0.302 | 0.238 | 0.294 | |
| InternVL2-2B2026.01 | 0.256 | 0.117 | 0.096 | 0.196 | 0.166 | |
| Mantis-8B-llama3Backbone=Llama3-8B2026.01 | 0.13 | 0.199 | 0.109 | 0.17 | 0.152 |