Image Clustering on CIFAR-10
0.95NMIDCR
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| DCRBackbone=SigLIP ViT-SO@224 (S-1), Zero-shot=true2026.03 | 0.95 | 0.98 | 0.95 | — | — | — | — | — | — | |
| Original CLIPBackbone=SigLIP ViT-SO@224 (S-1), Zero-shot=true2026.03 | 0.94 | 0.97 | 0.95 | — | — | — | — | — | — | |
| DIVABackbone=SigLIP ViT-SO@224 (S-1), Zero-shot=true2026.03 | 0.94 | 0.98 | 0.95 | — | — | — | — | — | — | |
| PRCutBackbone=VitL-142025.02 | 0.934 | 0.975 | — | — | — | — | — | — | — | |
| TurtleBackbone=VitL-142025.02 | 0.929 | 0.972 | — | — | — | — | — | — | — | |
| Spectral ClusteringEmbedding Model=DINOv3-B, K=10, Q=0.932025.11 | 0.908 | 0.875 | — | — | — | — | — | 14 | 0.33 | |
| Spectral ClusteringK=10, Q=0.92, Embeddings=CLIP ViT-L/142025.11 | 0.898 | 0.874 | — | — | — | — | — | 18 | 0.4 | |
| DCRBackbone=OpenAI CLIP ViT-L@224 (O-1), Zero-shot=true2026.03 | 0.89 | 0.86 | 0.8 | — | — | — | — | — | — | |
| ProPosTraining paradigm=improving representation learning2021.11 | 0.886 | 0.943 | 0.884 | — | — | — | — | — | — | |
| H-RCutEmbedding Model=DINOv3-B, K=10, Q=0.932025.11 | 0.878 | 0.912 | — | — | — | — | — | 31.5 | 0.75 | |
| PRCut*K=10, Q=0.92, Embeddings=CLIP ViT-L/142025.11 | 0.876 | 0.896 | — | — | — | — | — | 37.5 | 0.82 | |
| Inference-Time Attention Engineering (ITAE)Backbone=ViT-B/14 (distilled)2024.10 | 0.8682 | 0.8449 | 0.7946 | — | — | — | — | — | — | |
| ConNREvaluation Protocol=k-means2023.12 | 0.867 | 0.932 | 0.861 | — | — | — | — | — | — | |
| SupervisedBackbone=ResNet182021.03 | 0.862 | 0.938 | 0.87 | — | — | — | — | — | — | |
| DINOv2 (original)Backbone=ViT-B/14 (distilled)2024.10 | 0.8604 | 0.8363 | 0.7775 | — | — | — | — | — | — | |
| K principal concept identification2021.04 | 0.859 | 0.934 | 0.861 | — | — | — | — | — | — | |
| SPICEBackbone=ResNet342021.03 | 0.858 | 0.917 | 0.836 | — | — | — | — | — | — | |
| LAIC frameworkBackbone=ViT-B/322026.03 | 0.852 | 0.929 | 0.848 | — | — | — | — | — | — | |
| ProPosEvaluation Protocol=k-means2023.12 | 0.851 | 0.916 | 0.835 | — | — | — | — | — | — | |
| SPICEBackbone=ResNet182021.03 | 0.85 | 0.918 | 0.836 | — | — | — | — | — | — | |
| MCABackbone=ViT-B/322026.03 | 0.849 | 0.927 | 0.846 | — | — | — | — | — | — | |
| SIC2023.10 | 0.847 | 0.926 | 0.844 | — | — | — | — | — | — | |
| DINOv2 with register tokensBackbone=ViT-B/14 (distilled)2024.10 | 0.847 | 0.8212 | 0.735 | — | — | — | — | — | — | |
| SIC2025.10 | 0.847 | 0.926 | 0.844 | — | — | — | — | — | — | |
| SICBackbone=ViT-B/322026.03 | 0.847 | 0.926 | 0.844 | — | — | — | — | — | — | |
| SIC2026.04 | 0.847 | 0.926 | 0.844 | — | — | — | — | — | — | |
| LFSSBackbone=ResNet2026.03 | 0.841 | 0.924 | 0.842 | — | — | — | — | — | — | |
| KEC_TAC2026.04 | 0.841 | 0.923 | 0.84 | — | — | — | — | — | — | |
| PRCut*Embedding Model=DINOv3-B, K=10, Q=0.932025.11 | 0.837 | 0.866 | — | — | — | — | — | 34.9 | 0.83 | |
| KEC_TURTLE2026.04 | 0.837 | 0.921 | 0.835 | — | — | — | — | — | — | |
| TAC_TURTLE2026.04 | 0.835 | 0.919 | 0.832 | — | — | — | — | — | — | |
| TACtrained=true2023.10 | 0.833 | 0.919 | 0.831 | — | — | — | — | — | — | |
| TACBackbone=ViT-B/322026.03 | 0.833 | 0.919 | 0.831 | — | — | — | — | — | — | |
| H-NCutEmbedding Model=DINOv3-B, K=10, Q=0.932025.11 | 0.833 | 0.856 | — | — | — | — | — | 46.1 | 1.1 | |
| ESMCProtocol=Average of 10 runs2025.11 | 0.8293 | — | — | — | — | — | — | — | — | |
| TAC2026.04 | 0.829 | 0.915 | 0.823 | — | — | — | — | — | — | |
| H-NCutK=10, Q=0.92, Embeddings=CLIP ViT-L/142025.11 | 0.827 | 0.839 | — | — | — | — | — | 40.8 | 0.97 | |
| GradNorm2025.10 | 0.826 | 0.911 | 0.815 | — | — | — | — | — | — | |
| GradNormBackbone=ViT-B/322026.03 | 0.826 | 0.911 | 0.815 | — | — | — | — | — | — | |
| H-RCutK=10, Q=0.92, Embeddings=CLIP ViT-L/142025.11 | 0.822 | 0.833 | — | — | — | — | — | 40.7 | 0.94 | |
| Original CLIPBackbone=OpenAI CLIP ViT-L@224 (O-1), Zero-shot=true2026.03 | 0.82 | 0.82 | 0.76 | — | — | — | — | — | — | |
| TCL2022.10 | 0.819 | 0.887 | 0.78 | — | — | — | — | — | — | |
| TCLTraining paradigm=directly outputting cluster assignments, Image size=224x2242021.11 | 0.819 | 0.887 | 0.78 | — | — | — | — | — | — | |
| TCL2023.12 | 0.819 | 0.887 | 0.78 | — | — | — | — | — | — | |
| TCL2025.10 | 0.819 | 0.887 | 0.78 | — | — | — | — | — | — | |
| TCLBackbone=ResNet2026.03 | 0.819 | 0.887 | 0.78 | — | — | — | — | — | — | |
| KEC (no train)Training Protocol=no train2026.04 | 0.819 | 0.907 | 0.806 | — | — | — | — | — | — | |
| BYOLTraining paradigm=learning general representations2021.11 | 0.817 | 0.894 | 0.79 | — | — | — | — | — | — | |
| TAC (no train)Training Protocol=no train2026.04 | 0.814 | 0.904 | 0.803 | — | — | — | — | — | — | |
| DIVABackbone=OpenAI CLIP ViT-L@224 (O-1), Zero-shot=true2026.03 | 0.81 | 0.82 | 0.75 | — | — | — | — | — | — | |
| un2CLIPBackbone=OpenAI CLIP ViT-L@224 (O-1), Zero-shot=true2026.03 | 0.81 | 0.82 | 0.74 | — | — | — | — | — | — | |
| TACtrained=false2023.10 | 0.808 | 0.901 | 0.798 | — | — | — | — | — | — | |
| TAC2025.10 | 0.808 | 0.901 | 0.798 | — | — | — | — | — | — | |
| CLIPEvaluation Protocol=zero-shot2023.10 | 0.807 | 0.9 | 0.793 | — | — | — | — | — | — | |
| CLIPmode=zero-shot2025.10 | 0.807 | 0.9 | 0.793 | — | — | — | — | — | — | |
| ZS-CLIPBackbone=ViT-B/32, zero-shot=true2026.03 | 0.807 | 0.9 | 0.793 | — | — | — | — | — | — | |
| CLIP (zero-shot)Training Protocol=zero-shot2026.04 | 0.807 | 0.9 | 0.793 | — | — | — | — | — | — | |
| PCL2022.10 | 0.802 | 0.874 | 0.766 | — | — | — | — | — | — | |
| PCLTraining paradigm=improving representation learning2021.11 | 0.802 | 0.874 | 0.766 | — | — | — | — | — | — | |
| DCRBackbone=MetaCLIP ViT-L@224 (M-1), Zero-shot=true2026.03 | 0.8 | 0.82 | 0.76 | — | — | — | — | — | — | |
| SeCu2025.10 | 0.799 | 0.885 | 0.782 | — | — | — | — | — | — | |
| SCAN2021.05 | 0.797 | 0.883 | 0.772 | — | — | — | — | — | — | |
| SCANTraining paradigm=multi-stage methods2021.11 | 0.797 | 0.883 | 0.772 | — | — | — | — | — | — | |
| SCANBackbone=ResNet182021.03 | 0.797 | 0.883 | 0.772 | — | — | — | — | — | — | |
| SCAN2023.12 | 0.797 | 0.883 | 0.772 | — | — | — | — | — | — | |
| SCAN2023.10 | 0.797 | 0.883 | 0.772 | — | — | — | — | — | — | |
| SCAN2025.10 | 0.797 | 0.883 | 0.772 | — | — | — | — | — | — | |
| SCANBackbone=ResNet2026.03 | 0.797 | 0.883 | 0.772 | — | — | — | — | — | — | |
| SCAN2022.10 | 0.796 | 0.861 | 0.75 | — | — | — | — | — | — | |
| PRO-DSCBackbone=ViT-B/322026.03 | 0.796 | 0.871 | 0.802 | — | — | — | — | — | — | |
| BYOLEvaluation Protocol=k-means2023.12 | 0.794 | 0.878 | 0.766 | — | — | — | — | — | — | |
| TCLICHclustering=k-means on ICH features2022.10 | 0.792 | 0.867 | 0.737 | — | — | — | — | — | — | |
| TCCTraining paradigm=directly outputting cluster assignments2021.11 | 0.79 | 0.906 | 0.733 | — | — | — | — | — | — | |
| TCC2023.12 | 0.79 | 0.906 | 0.733 | — | — | — | — | — | — | |
| TCC2023.10 | 0.79 | 0.906 | 0.733 | — | — | — | — | — | — | |
| TCCbackbone=Same CNN backbone as TCC2021.06 | 0.79 | 0.906 | 0.733 | — | — | — | — | — | — | |
| Original CLIPBackbone=MetaCLIP ViT-L@224 (M-1), Zero-shot=true2026.03 | 0.79 | 0.73 | 0.67 | — | — | — | — | — | — | |
| TCC2025.10 | 0.79 | 0.906 | 0.733 | — | — | — | — | — | — | |
| TCCBackbone=ResNet2026.03 | 0.79 | 0.906 | 0.733 | — | — | — | — | — | — | |
| PT+SCAN2021.04 | 0.787 | 0.876 | 0.758 | — | — | — | — | — | — | |
| SimSiamTraining paradigm=learning general representations2021.11 | 0.786 | 0.856 | 0.736 | — | — | — | — | — | — | |
| SCAN_MoCoBackbone=ResNet182021.03 | 0.786 | 0.874 | 0.756 | — | — | — | — | — | — | |
| TURTLE (1-space)Training Protocol=1-space2026.04 | 0.786 | 0.865 | 0.751 | — | — | — | — | — | — | |
| BYOLBackbone=ResNet2026.03 | 0.78 | 0.875 | 0.752 | — | — | — | — | — | — | |
| DIVABackbone=MetaCLIP ViT-L@224 (M-1), Zero-shot=true2026.03 | 0.77 | 0.79 | 0.72 | — | — | — | — | — | — | |
| ChLinkage function=Chamfer2026.02 | 0.767 | — | 0.689 | — | — | — | — | — | — | |
| GCCTraining paradigm=directly outputting cluster assignments2021.11 | 0.764 | 0.856 | 0.728 | — | — | — | — | — | — | |
| GCC2023.12 | 0.764 | 0.856 | 0.728 | — | — | — | — | — | — | |
| GCC2023.10 | 0.764 | 0.856 | 0.728 | — | — | — | — | — | — | |
| GCC2025.10 | 0.764 | 0.856 | 0.728 | — | — | — | — | — | — | |
| GCCBackbone=ResNet2026.03 | 0.764 | 0.856 | 0.728 | — | — | — | — | — | — | |
| ConCURLStrategy=max-performance2021.05 | 0.762 | 0.846 | 0.715 | — | — | — | — | — | — | |
| IDECPoints=60,000, Dim=128, Clusters=102026.02 | 0.76 | — | — | — | — | — | — | — | — | |
| RPSC2025.10 | 0.754 | 0.857 | 0.731 | — | — | — | — | — | — | |
| NMMTraining paradigm=multi-stage methods2021.11 | 0.748 | 0.843 | 0.709 | — | — | — | — | — | — | |
| NNMBackbone=ResNet182021.03 | 0.748 | 0.843 | 0.709 | — | — | — | — | — | — | |
| NMM2023.12 | 0.748 | 0.843 | 0.709 | — | — | — | — | — | — | |
| NNMarchitecture=SimCLR based2026.01 | 0.748 | 0.843 | 0.709 | — | — | — | — | — | — | |
| Ward'sLinkage function=Ward's2026.02 | 0.746 | — | 0.69 | — | — | — | — | — | — | |
| KBCPoints=60,000, Dim=128, Clusters=102026.02 | 0.74 | — | — | — | — | — | — | — | — |