Classification on ColonINST (unseen)
83.24AccuracyColonGPT
Evaluation Results
| Method | Links | |
|---|---|---|
| ColonGPTVisual encoder=SigLIP-SO (384px), Language model=Phi1.5 (1.3B), LoRA=false, EXT=false2024.10 | 83.24 | |
| LLaVA-v1.5Visual encoder=CLIP-L/14 (336px), Language model=Vicuna-v1.5 (7B), LoRA=true, EXT=true2024.10 | 80.89 | |
| MobileVLM-1.7BVisual encoder=CLIP-L/14 (336px), Language model=MobileLLaMA (1.4B), LoRA=true, EXT=true2024.10 | 80.44 | |
| Bunny-v1.0-3BVisual encoder=SigLIP-SO (384px), Language model=Phi2 (2.7B), LoRA=true, EXT=true2024.10 | 79.5 | |
| LLaVA-Med-v1.5Visual encoder=CLIP-L/14 (224px), Language model=Mistral-v0.2 (7B), LoRA=true, EXT=false2024.10 | 79.24 | |
| LLaVA-v1.5Visual encoder=CLIP-L/14 (336px), Language model=Vicuna-v1.5 (7B), LoRA=true, EXT=false2024.10 | 79.1 | |
| MGM-2BVisual encoder=CLIP-L/14 (336px) & ConvNeXt-L (768px), Language model=Gemma (2B), LoRA=false, EXT=false2024.10 | 78.99 | |
| MobileVLM-1.7BVisual encoder=CLIP-L/14 (336px), Language model=MobileLLaMA (1.4B), LoRA=true, EXT=false2024.10 | 78.75 | |
| MGM-2BVisual encoder=CLIP-L/14 (336px) & ConvNeXt-L (768px), Language model=Gemma (2B), LoRA=true, EXT=false2024.10 | 78.69 | |
| LLaVA-Med-v1.0Visual encoder=CLIP-L/14 (224px), Language model=LLaMA1 (7B), LoRA=false, EXT=false2024.10 | 78.04 | |
| MiniGPT-v2Visual encoder=EVA-G/14 (448px), Language model=LLaMA2 (7B), LoRA=false, EXT=false2024.10 | 77.93 | |
| LLaVA-Med-v1.0Visual encoder=CLIP-L/14 (224px), Language model=LLaMA1 (7B), LoRA=true, EXT=false2024.10 | 77.38 | |
| MiniGPT-v2Visual encoder=EVA-G/14 (448px), Language model=LLaMA2 (7B), LoRA=true, EXT=true2024.10 | 76.82 | |
| Bunny-v1.0-3BVisual encoder=SigLIP-SO (384px), Language model=Phi2 (2.7B), LoRA=true, EXT=false2024.10 | 75.5 | |
| LLaVA-v1Visual encoder=CLIP-L/14 (224px), Language model=Vicuna-v1.3 (7B), LoRA=true, EXT=false2024.10 | 72.08 | |
| LLaVA-Med-v1.5Visual encoder=CLIP-L/14 (224px), Language model=Mistral-v0.2 (7B), LoRA=false, EXT=false2024.10 | 66.51 | |
| LLaVA-v1Visual encoder=CLIP-L/14 (224px), Language model=Vicuna-v1.3 (7B), LoRA=true, EXT=true2024.10 | 42.17 |