REC on ColonINST (unseen)
0.5624IoUColonGPT
Evaluation Results
| Method | Links | |
|---|---|---|
| ColonGPTVisual encoder=SigLIP-SO (384px), Language model=Phi1.5 (1.3B), LoRA=false, EXT=false2024.10 | 0.5624 | |
| LLaVA-v1.5Visual encoder=CLIP-L/14 (336px), Language model=Vicuna-v1.5 (7B), LoRA=true, EXT=true2024.10 | 0.4231 | |
| LLaVA-Med-v1.5Visual encoder=CLIP-L/14 (224px), Language model=Mistral-v0.2 (7B), LoRA=true, EXT=false2024.10 | 0.4197 | |
| Bunny-v1.0-3BVisual encoder=SigLIP-SO (384px), Language model=Phi2 (2.7B), LoRA=true, EXT=true2024.10 | 0.4148 | |
| MobileVLM-1.7BVisual encoder=CLIP-L/14 (336px), Language model=MobileLLaMA (1.4B), LoRA=true, EXT=true2024.10 | 0.348 | |
| LLaVA-v1.5Visual encoder=CLIP-L/14 (336px), Language model=Vicuna-v1.5 (7B), LoRA=true, EXT=false2024.10 | 0.3432 | |
| MobileVLM-1.7BVisual encoder=CLIP-L/14 (336px), Language model=MobileLLaMA (1.4B), LoRA=true, EXT=false2024.10 | 0.3146 | |
| Bunny-v1.0-3BVisual encoder=SigLIP-SO (384px), Language model=Phi2 (2.7B), LoRA=true, EXT=false2024.10 | 0.3124 | |
| MiniGPT-v2Visual encoder=EVA-G/14 (448px), Language model=LLaMA2 (7B), LoRA=true, EXT=true2024.10 | 0.3113 | |
| MGM-2BVisual encoder=CLIP-L/14 (336px) & ConvNeXt-L (768px), Language model=Gemma (2B), LoRA=true, EXT=false2024.10 | 0.2523 | |
| LLaVA-Med-v1.0Visual encoder=CLIP-L/14 (224px), Language model=LLaMA1 (7B), LoRA=false, EXT=false2024.10 | 0.2489 | |
| LLaVA-Med-v1.0Visual encoder=CLIP-L/14 (224px), Language model=LLaMA1 (7B), LoRA=true, EXT=false2024.10 | 0.2085 | |
| MGM-2BVisual encoder=CLIP-L/14 (336px) & ConvNeXt-L (768px), Language model=Gemma (2B), LoRA=false, EXT=false2024.10 | 0.16 | |
| MiniGPT-v2Visual encoder=EVA-G/14 (448px), Language model=LLaMA2 (7B), LoRA=false, EXT=false2024.10 | 0.1536 | |
| LLaVA-Med-v1.5Visual encoder=CLIP-L/14 (224px), Language model=Mistral-v0.2 (7B), LoRA=false, EXT=false2024.10 | 0.1295 | |
| LLaVA-v1Visual encoder=CLIP-L/14 (224px), Language model=Vicuna-v1.3 (7B), LoRA=true, EXT=false2024.10 | 0.1272 | |
| LLaVA-v1Visual encoder=CLIP-L/14 (224px), Language model=Vicuna-v1.3 (7B), LoRA=true, EXT=true2024.10 | 0.0324 |