Generalized Category Discovery on Stanford Cars
91.1Accuracy (All)ZS CLIP H/14
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| ZS CLIP H/14Textual Source=Class Names2026.02 | 91.1 | — | — | 93.9 | 89.8 | — | — | — | |
| SSR2-GCDBackbone=CLIP2026.02 | 89.2 | — | — | 93.1 | 87.3 | — | — | — | |
| SSR2-GCD2026.02 | 89.2 | — | — | 93.1 | 87.3 | — | — | — | |
| SpectralGCDTextual Source=Tags2026.02 | 89.1 | — | — | 92.6 | 87.4 | — | — | — | |
| SDBA + TextGCDBackbone=CLIP2026.06 | 87.6 | — | — | 92.6 | 85.1 | — | — | — | |
| TextGCDTextual Source=Tags + Attributes2026.02 | 86.9 | — | — | 87.4 | 86.7 | — | — | — | |
| TextGCDEncoder=Image & Text, Backbone=CLIP2025.09 | 86.9 | — | — | 87.4 | 86.7 | — | — | — | |
| TextGCDBackbone=CLIP2026.06 | 86.9 | — | — | 87.4 | 86.7 | — | — | — | |
| TextGCD*Textual Source=Tags2026.02 | 86.2 | — | — | 91.2 | 83.8 | — | — | — | |
| TextGCDBackbone=CLIP2026.02 | 86.1 | — | — | 91.8 | 83.9 | — | — | — | |
| TextGCD2026.02 | 86.1 | — | — | 91.8 | 83.9 | — | — | — | |
| Hyp-SelExBackbone=DINOv22025.04 | 83.8 | — | — | 93.3 | 79.2 | — | — | — | |
| Hyp-SelExVenue=CVPR’25, Backbone=DINOv22025.09 | 83.8 | — | — | 93.3 | 79.2 | — | — | — | |
| Hyp-SimGCDBackbone=DINOv22025.04 | 82.5 | — | — | 85.8 | 81 | — | — | — | |
| Hyp-SimGCDVenue=CVPR’25, Backbone=DINOv22025.09 | 82.5 | — | — | 85.8 | 81 | — | — | — | |
| PartCo-SelExVenue=Ours, Backbone=DINOv22025.09 | 82.5 | — | — | 91.8 | 78 | — | — | — | |
| SelExBackbone=DINOv22025.04 | 82.2 | — | — | 93.7 | 76.7 | — | — | — | |
| SelExVenue=ECCV’24, Backbone=DINOv22025.09 | 82.2 | — | — | 93.7 | 76.7 | — | — | — | |
| PartCo-SelExVenue=Ours, Backbone=DINOv32025.09 | 81.7 | — | — | 92.1 | 76.6 | — | — | — | |
| NCGCD-SelExVenue=NeurIPS’25, Backbone=DINOv22025.09 | 81.1 | — | — | 90.9 | 79.3 | — | — | — | |
| PartCo-FlipClassVenue=Ours, Backbone=DINOv22025.09 | 80.5 | — | — | 92.7 | 74.6 | — | — | — | |
| SDBA + GETBackbone=CLIP2026.06 | 80.5 | — | — | 87.8 | 77 | — | — | — | |
| PartCo-SPTNetVenue=Ours, Backbone=DINOv22025.09 | 80.1 | — | — | 92 | 73.5 | — | — | — | |
| CMS-CLIP + AL-GCDBackbone=CLIP, Ground-truth number of categories K=Given2026.03 | 80 | — | — | 90.3 | 75 | — | — | — | |
| CMS-CLIP + AL-GCDBackbone=CLIP, K (Ground-truth number of categories)=Not given2026.03 | 79.9 | — | — | 90.5 | 74.7 | — | — | — | |
| CMS-CLIP + AL-GCDBackbone=CLIP, Ground-truth number of categories K=Not Given2026.03 | 79.9 | — | — | 90.5 | 74.7 | — | — | — | |
| ConGCD-SelExVenue=ICCV’25, Backbone=DINOv22025.09 | 79.8 | — | — | 93.1 | 73.3 | — | — | — | |
| RLCDVenue=ICML’25, Backbone=DINOv22025.09 | 79.5 | — | — | 91.8 | 73.5 | — | — | — | |
| SelEx-CLIP + AL-GCDBackbone=CLIP, Ground-truth number of categories K=Given2026.03 | 79 | — | — | 90.8 | 73.6 | — | — | — | |
| PartCo-SimGCDVenue=Ours, Backbone=DINOv22025.09 | 78.9 | — | — | 91.5 | 72.8 | — | — | — | |
| SelExVenue=ECCV’24, Backbone=DINOv32025.09 | 78.8 | — | — | 90.3 | 73.3 | — | — | — | |
| GETTextual Source=InversionNet2026.02 | 78.5 | — | — | 86.8 | 74.5 | — | — | — | |
| GETBackbone=CLIP2026.02 | 78.5 | — | — | 86.8 | 74.5 | — | — | — | |
| GET2026.02 | 78.5 | — | — | 86.8 | 74.5 | — | — | — | |
| GETBackbone=CLIP, Ground-truth number of categories K=Given2026.03 | 78.5 | — | — | 86.8 | 74.5 | — | — | — | |
| GETEncoder=Image & Text, Backbone=CLIP2025.09 | 78.5 | — | — | 86.8 | 74.5 | — | — | — | |
| PartCo-SimGCDVenue=Ours, Backbone=DINOv32025.09 | 78.5 | — | — | 86.5 | 74.6 | — | — | — | |
| GETBackbone=CLIP2026.06 | 78.5 | — | — | 86.8 | 74.5 | — | — | — | |
| SimGCD-CLIP + AL-GCDBackbone=CLIP, Ground-truth number of categories K=Given2026.03 | 78.3 | — | — | 86.3 | 74.4 | — | — | — | |
| PartGCDVenue=TMM, Backbone=DINOv22025.09 | 78.2 | — | — | 88.7 | 73.1 | — | — | — | |
| FlipClassVenue=NeurIPS’24, Backbone=DINOv22025.09 | 78 | — | — | 88 | 73.2 | — | — | — | |
| CMS-CLIPBackbone=CLIP, Ground-truth number of categories K=Given2026.03 | 77.9 | — | — | 89 | 72.6 | — | — | — | |
| SEALVenue=NeurIPS’25, Backbone=DINOv22025.09 | 77.7 | — | — | 88.7 | 72.4 | — | — | — | |
| ProtoGCDVenue=TPAMI, Backbone=DINOv22025.09 | 77.6 | — | — | 90.5 | 71.5 | — | — | — | |
| CMS-CLIP (CVPR 24)Backbone=CLIP, K (Ground-truth number of categories)=Not given2026.03 | 77.2 | — | — | 87.3 | 72.3 | — | — | — | |
| CMS-CLIPBackbone=CLIP, Ground-truth number of categories K=Not Given2026.03 | 77.2 | — | — | 87.3 | 72.3 | — | — | — | |
| PartCo-SimGCD (Ours)Encoder=Image, Backbone=CLIP2025.09 | 76.5 | — | — | 89.6 | 70.2 | — | — | — | |
| AllGCDVenue=ICCV’25, Backbone=DINOv22025.09 | 76.2 | — | — | 88.3 | 70.4 | — | — | — | |
| µGCDBackbone=DINOv22025.04 | 76.1 | — | — | 91 | 68.9 | — | — | — | |
| µGCDVenue=NeurIPS’23, Backbone=DINOv22025.09 | 76.1 | — | — | 91 | 68.9 | — | — | — | |
| SimGCDBackbone=CLIP, reproduced=true2026.02 | 75.9 | — | — | 81.4 | 73.1 | — | — | — | |
| AFGCDVenue=ICCV’25, Backbone=DINOv22025.09 | 75.5 | — | — | 86.2 | 70.3 | — | — | — | |
| MOSVenue=CVPR’25, Backbone=DINOv22025.09 | 75.5 | — | — | 89.6 | 68.7 | — | — | — | |
| DebGCDVenue=ICLR’25, Backbone=DINOv22025.09 | 75.4 | — | — | 87.7 | 69.5 | — | — | — | |
| CPTBackbone=CLIP, Ground-truth number of categories K=Given2026.03 | 74.2 | — | — | 84.3 | 69.3 | — | — | — | |
| CPTEncoder=Image & Text, Backbone=CLIP2025.09 | 74.2 | — | — | 84.3 | 69.3 | — | — | — | |
| SimGCDVenue=ICCV’23, Backbone=DINOv32025.09 | 73.9 | — | — | 79.4 | 71.3 | — | — | — | |
| APLVenue=CVPR’25, Backbone=DINOv22025.09 | 73.4 | — | — | 87.6 | 66.7 | — | — | — | |
| Hyp-GCDBackbone=DINOv22025.04 | 72.8 | — | — | 80.4 | 69.1 | — | — | — | |
| SPTNetVenue=ICLR’24, Backbone=DINOv22025.09 | 72.3 | — | — | 82 | 67.5 | — | — | — | |
| SimGCDBackbone=DINOv22025.04 | 71.5 | — | — | 81.9 | 66.6 | — | — | — | |
| SimGCDVenue=ICCV’23, Backbone=DINOv22025.09 | 71.5 | — | — | 81.9 | 66.6 | — | — | — | |
| ClipGCDTextual Source=CC-12M2026.02 | 70.6 | — | — | 88.2 | 62.2 | — | — | — | |
| CLIP-GCDEncoder=Image & Text, Backbone=CLIP2025.09 | 70.6 | — | — | 88.2 | 62.2 | — | — | — | |
| ClipGCDBackbone=CLIP2026.06 | 70.6 | — | — | 88.2 | 62.2 | — | — | — | |
| SimGCDEncoder=Image, Backbone=CLIP2025.09 | 70 | — | — | 83.4 | 63.5 | — | — | — | |
| SimGCD-CLIPBackbone=CLIP2026.06 | 70 | — | — | 83.4 | 63.5 | — | — | — | |
| SimGCD-CLIPBackbone=CLIP, Ground-truth number of categories K=Given, reproduced=true2026.03 | 69.4 | — | — | 82.2 | 62.9 | — | — | — | |
| SelEx-CLIPBackbone=CLIP, Ground-truth number of categories K=Given, reproduced=true2026.03 | 68.8 | — | — | 68.4 | 69 | — | — | — | |
| CiPRBackbone=DINOv22025.04 | 66.7 | — | — | 77 | 61.8 | — | — | — | |
| CiPRVenue=TMLR, Backbone=DINOv22025.09 | 66.7 | — | — | 77 | 61.8 | — | — | — | |
| OAKBackbone=CLIP ViT-B/162025.12 | 65.9 | — | — | 71 | 63.4 | — | — | — | |
| GCDBackbone=DINOv22025.04 | 65.7 | — | — | 67.8 | 64.7 | — | — | — | |
| GCDVenue=CVPR’22, Backbone=DINOv22025.09 | 65.7 | — | — | 67.8 | 64.7 | — | — | — | |
| PartGCDBackbone=DINO2026.06 | 65.6 | — | — | 79.5 | 58.9 | — | — | — | |
| Sharpness-aware Dynamic Anchor Selection (Ours)Backbone=ViT-B/162025.12 | 65.5 | — | — | 79.7 | 58.8 | — | — | — | |
| RPC2026.05 | 65.5 | — | — | 81 | 57.8 | — | — | — | |
| SADABackbone=DINO2026.06 | 65.5 | — | — | 79.7 | 58.8 | — | — | — | |
| DebGCD2026.02 | 65.3 | — | — | 81.6 | 57.4 | — | — | — | |
| DebGCD2026.05 | 65.3 | — | — | 81.6 | 57.4 | — | — | — | |
| OursKnown C=GT (196)2025.12 | 65.2 | — | — | 79.7 | 58.8 | — | — | — | |
| GCDEncoder=Image, Backbone=CLIP2025.09 | 65.1 | — | — | 75.9 | 59.8 | — | — | — | |
| GCD-CLIPBackbone=CLIP2026.06 | 65.1 | — | — | 75.9 | 59.8 | — | — | — | |
| RLCDBackbone=DINO, Ground-truth number of categories K=Given2026.03 | 64.9 | — | — | 79.3 | 58 | — | — | — | |
| MOSVenue/Year=our2025.03 | 64.6 | 80.9 | 56.7 | — | — | — | — | — | |
| OursKnown C=Est. (230)2025.12 | 64.4 | — | — | 77.8 | 57.9 | — | — | — | |
| CLIP-ZS + GT vocabBackbone=CLIP ViT-B/162025.12 | 64 | — | — | 70 | 61.1 | — | — | — | |
| Hyp-SelExBackbone=DINO2025.04 | 62.9 | — | — | 80 | 54.7 | — | — | — | |
| Hyp-SelExBackbone=DINOv12026.02 | 62.9 | — | — | 80 | 54.7 | — | — | — | |
| Hyp-SimGCDBackbone=DINO2025.04 | 62.8 | — | — | 73.4 | 57.7 | — | — | — | |
| CLIP-GCDBackbone=CLIP2026.02 | 62.8 | — | — | 77.1 | 55.7 | — | — | — | |
| GCDBackbone=CLIP ViT-B/162025.12 | 62.7 | — | — | 75.4 | 56.6 | — | — | — | |
| AdaptGCDBackbone=DINO2026.06 | 62.7 | — | — | 80.6 | 54 | — | — | — | |
| GCD-CLIPBackbone=CLIP, Ground-truth number of categories K=Given2026.03 | 62.5 | — | — | 73.9 | 57 | — | — | — | |
| ZS CLIP B/16Textual Source=Class Names2026.02 | 61.3 | — | — | 67.6 | 58.2 | — | — | — | |
| InfoSculpt2026.01 | 59.5 | — | — | 78.4 | 42.1 | — | — | — | |
| SPTNetVenue/Year=ICLR/20242025.03 | 59 | 79.2 | 49.3 | — | — | — | — | — | |
| SPTNetBackbone=DINO2025.04 | 59 | — | — | 79.2 | 49.3 | — | — | — | |
| SPTNetBackbone=ViT-B/162025.12 | 59 | — | — | 79.2 | 49.3 | — | — | — | |
| SPTNetTextual Source=✗2026.02 | 59 | — | — | 79.2 | 49.3 | — | — | — |