Image Clustering on CLEVR
18.9NMICLIP (k-means)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CLIP (k-means)Backbone=ViT-B/32, Training Strategy=Training-free2026.04 | 18.9 | 27.6 | 8.1 | |
| KEC_TURTLEBackbone=ViT-B/32, Training Strategy=TURTLE2026.04 | 18.8 | 28.6 | 8 | |
| TAC_TURTLEBackbone=ViT-B/32, Training Strategy=TURTLE2026.04 | 16.6 | 25.8 | 7.5 | |
| CLIP (zero-shot)Backbone=ViT-B/32, Evaluation Protocol=Zero-shot with GT labels2026.04 | 16.4 | 4.4 | 8 | |
| KEC (no train)Backbone=ViT-B/32, Training Strategy=Training-free2026.04 | 16.3 | 26.6 | 8.9 | |
| TURTLE (1-space)Backbone=ViT-B/322026.04 | 16 | 24.6 | 7 | |
| KEC_TACBackbone=ViT-B/32, Training Strategy=TAC2026.04 | 15.9 | 25.4 | 6.8 | |
| TAC (no train)Backbone=ViT-B/32, Training Strategy=Training-free2026.04 | 11.8 | 23.6 | 5.4 | |
| TACBackbone=ViT-B/32, Training Strategy=TAC2026.04 | 8.4 | 22.4 | 3.6 | |
| VLM Caption + ClusterLLM=GPT-4o2026.04 | 5.6 | 10.8 | 3 | |
| SICBackbone=ViT-B/322026.04 | 5.2 | 20.6 | 1.5 |