Image Segmentation on COCO
73.2mIoUClean
Evaluation Results
| Method | Links | |
|---|---|---|
| CleanPrompt=Box, SAM Model=SAM-Huge2026.05 | 73.2 | |
| CleanPrompt=Box, SAM Model=SAM-Large2026.05 | 73 | |
| Adaptformer + SAM-COBOTTrainable Parameters (K)=324.0, Backbone=ViT-Base2023.11 | 72.2 | |
| LoRA + SAM-COBOTTrainable Parameters (K)=148.3, Backbone=ViT-Base2023.11 | 72.1 | |
| LoRATrainable Parameters (K)=147.4, Backbone=ViT-Base2023.11 | 71.8 | |
| AdaptformerTrainable Parameters (K)=322.7, Backbone=ViT-Base2023.11 | 71.7 | |
| CleanPrompt=Box, SAM Model=SAM-Base2026.05 | 71.4 | |
| UADPrompt=Box, SAM Model=SAM-Huge2026.05 | 71.1 | |
| UADPrompt=Box, SAM Model=SAM-Large2026.05 | 70.5 | |
| LightweightTrainable Parameters (K)=0, Backbone=ViT-Base2023.11 | 70.4 | |
| CLIP-Guided SAM (CLIP-B + SAM-B)Total Params=197M†, Trainable Params=49M, Label Fraction=1/32 (3697)2026.05 | 69.2 | |
| SAM 3Total Params=840M, Trainable Params=23M*, Label Fraction=1/512 (232)2026.05 | 68.8 | |
| UADPrompt=Box, SAM Model=SAM-Base2026.05 | 68 | |
| CLIP-Guided SAM (CLIP-B + SAM-B)Total Params=197M†, Trainable Params=49M, Label Fraction=1/64 (1849)2026.05 | 67.7 | |
| CLIP-Guided SAM (CLIP-B + SAM-B)Total Params=197M†, Trainable Params=49M, Label Fraction=1/128 (925)2026.05 | 65.8 | |
| CLIP-Guided SAM (CLIP-L + SAM-B)Total Params=543M, Trainable Params=126M, Label Fraction=1/512 (232)2026.05 | 65 | |
| SAM 3Total Params=840M, Trainable Params=23M*, Zero-shot=true2026.05 | 63.7 | |
| CLIP-Guided SAM (CLIP-B + SAM-B)Total Params=197M†, Trainable Params=49M, Label Fraction=1/256 (463)2026.05 | 63.2 | |
| CLIP-Guided SAM (CLIP-B + SAM-H)Total Params=809M, Trainable Params=50M, Label Fraction=1/512 (232)2026.05 | 61.2 | |
| CLIP-Guided SAM (CLIP-B + SAM-B)Total Params=197M†, Trainable Params=49M, Label Fraction=1/512 (232)2026.05 | 60.5 | |
| DarkLLMPrompt=Box, SAM Model=SAM-Large2026.05 | 55.5 | |
| DarkLLMPrompt=Box, SAM Model=SAM-Huge2026.05 | 55.1 | |
| FreezeTrainable Parameters (K)=0, Backbone=ViT-Base2023.11 | 53 | |
| CleanPrompt=Point, SAM Model=SAM-Huge2026.05 | 48.5 | |
| CleanPrompt=Point, SAM Model=SAM-Large2026.05 | 48.1 | |
| CleanPrompt=Point, SAM Model=SAM-Base2026.05 | 44.9 | |
| UADPrompt=Point, SAM Model=SAM-Huge2026.05 | 44.6 | |
| UADPrompt=Point, SAM Model=SAM-Large2026.05 | 44.2 | |
| UADPrompt=Point, SAM Model=SAM-Base2026.05 | 39.4 | |
| DarkLLMPrompt=Box, SAM Model=SAM-Base2026.05 | 30.5 | |
| CLIP-Guided SAM (CLIP-B + SAM-B)Total Params=197M†, Trainable Params=49M, Zero-shot=true2026.05 | 28 | |
| TAMBackbone=Qwen3-VL2026.04 | 25 | |
| DarkLLMPrompt=Point, SAM Model=SAM-Huge2026.05 | 24.3 | |
| AttnLRPBackbone=Qwen3-VL2026.04 | 24 | |
| vStreamBackbone=Qwen3-VL2026.04 | 24 | |
| DarkLLMPrompt=Point, SAM Model=SAM-Large2026.05 | 22 | |
| InputGradBackbone=Qwen3-VL2026.04 | 21 | |
| AttentionBackbone=Qwen3-VL2026.04 | 19 | |
| DarkLLMPrompt=Point, SAM Model=SAM-Base2026.05 | 3.5 |