3D Object Classification on ModelNet40
93.5Top-1 AccuracyTAMM
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| TAMMPre-Training Dataset=Ensembled, Evaluation Protocol=Linear Probing2024.02 | 93.5 | — | — | — | — | — | — | — | — | — | — | — | |
| PaPE2026.02 | 93.3 | — | — | — | — | — | — | — | — | — | — | — | |
| nD-ALiBi2026.02 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | |
| RoPE2026.02 | 93 | — | — | — | — | — | — | — | — | — | — | — | |
| RoPE-Mixed2026.02 | 93 | — | — | — | — | — | — | — | — | — | — | — | |
| PaPE-RIrotation-invariant=true2026.02 | 92.7 | — | — | — | — | — | — | — | — | — | — | — | |
| nD-sincos2026.02 | 92.2 | — | — | — | — | — | — | — | — | — | — | — | |
| DECsetting=16-shot2026.04 | 91.49 | — | — | — | — | — | — | — | — | — | — | — | |
| OpenShapePre-Training Dataset=Ensembled, Evaluation Protocol=Linear Probing2024.02 | 91.3 | — | — | — | — | — | — | — | — | — | — | — | |
| TAMMPre-Training Dataset=ShapeNet, Evaluation Protocol=Linear Probing2024.02 | 91 | — | — | — | — | — | — | — | — | — | — | — | |
| PointNet++setting=fully supervised2026.04 | 90.7 | — | — | — | — | — | — | — | — | — | — | — | |
| ULIPPre-Training Dataset=ShapeNet, Evaluation Protocol=Linear Probing2024.02 | 90.6 | — | — | — | — | — | — | — | — | — | — | — | |
| PointCLIP V2setting=16-shot2026.04 | 89.55 | — | — | — | — | — | — | — | — | — | — | — | |
| SAGE-7BTraining Dataset=Objaverse paired with Cap3D generated captions, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 88.9 | — | — | — | — | — | — | — | 98.3 | 94.7 | — | — | |
| Uni3D-baseteacher=EVA-CLIP-18B, data=Ensembled, zero-shot=true2024.02 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | |
| OpenShapePre-Training Dataset=ShapeNet, Evaluation Protocol=Linear Probing2024.02 | 88.5 | — | — | — | — | — | — | — | — | — | — | — | |
| 3DAlign-DAERZero-shot=true2025.11 | 88.5 | — | — | — | — | — | — | — | 99.5 | 98.6 | — | — | |
| Uni3D-baseteacher=EVA-CLIP-18B, data=w/o LVIS, zero-shot=true2024.02 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Uni3D-baseteacher=EVA-CLIP-8B, data=w/o LVIS, zero-shot=true2024.02 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | |
| RECON++-LPre-training Data=Ensembled, Scale=Large2024.02 | 87.3 | — | — | — | — | — | — | — | 96.1 | 95.4 | — | — | |
| MixCon3DPre-training Data=Ensembled2024.02 | 86.8 | — | — | — | — | — | — | — | 98.3 | 96.9 | — | — | |
| MixCon3DTraining Dataset=Ensembled, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 86.8 | — | — | — | — | — | — | — | 98.3 | 96.9 | — | — | |
| Uni3D-gVenue=ICLR 2024, Zero-shot=true2025.11 | 86.7 | — | — | — | — | — | — | — | 99.1 | 96.9 | — | — | |
| RECON++-BPre-training Data=Ensembled, Scale=Base2024.02 | 86.5 | — | — | — | — | — | — | — | 95.8 | 94.7 | — | — | |
| RECON++-BTraining Dataset=Ensembled, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 86.5 | — | — | — | — | — | — | — | 95.8 | 94.7 | — | — | |
| Uni3D-LVenue=ICLR 2024, Zero-shot=true2025.11 | 86.4 | — | — | — | — | — | — | — | 98.2 | 96.7 | — | — | |
| ReCon++-L (shapeLLM)Venue=ECCV 2024, Zero-shot=true2025.11 | 86.4 | — | — | — | — | — | — | — | 95.9 | 94.8 | — | — | |
| Uni3D-baseteacher=EVA-02-CLIP-E/14+, data=Ensembled, zero-shot=true2024.02 | 86.3 | — | — | — | — | — | — | — | — | — | — | — | |
| Uni3D-BPre-training Data=Ensembled, Teacher=EVA-CLIP-E2024.02 | 86.3 | — | — | — | — | — | — | — | 97.9 | 96.5 | — | — | |
| Uni3D-LPre-training Data=Ensembled, Teacher=EVA-CLIP-E2024.02 | 86.3 | — | — | — | — | — | — | — | 98.3 | 96.8 | — | — | |
| Uni3D-BTraining Dataset=Ensembled, Teacher Backbone=EVA-CLIP-E [52]2026.03 | 86.3 | — | — | — | — | — | — | — | 97.9 | 96.5 | — | — | |
| Uni3D-LTraining Dataset=Ensembled, Teacher Backbone=EVA-CLIP-E [52]2026.03 | 86.3 | — | — | — | — | — | — | — | 98.3 | 96.8 | — | — | |
| Uni3D-BVenue=ICLR 2024, Zero-shot=true2025.11 | 86.2 | — | — | — | — | — | — | — | 97.8 | 96.6 | — | — | |
| Uni3D-baseteacher=EVA-02-CLIP-E/14+, data=w/o LVIS, zero-shot=true2024.02 | 86.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Uni3D-baseteacher=OpenCLIP-G/14, data=w/o LVIS, zero-shot=true2024.02 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | |
| TAMMPre-training Data=Ensembled2024.02 | 85 | — | — | — | — | — | — | — | 98.1 | 96.6 | — | — | |
| Point-BERT (ULIP-2)Pre-train dataset=Objaverse + ShapeNet, Pre-train method=ULIP-2, Manual captions?=false, Zero-shot=true2023.05 | 84.7 | — | — | — | — | — | — | — | 97.1 | — | — | — | |
| OpenShape-PointBERTVenue=NeurIPS 2023, Zero-shot=true2025.11 | 84.5 | — | — | — | — | — | — | — | 98.1 | 96.4 | — | — | |
| Point-BERT (OpenShape)Pre-train dataset=Objaverse + ShapeNet + (2 extra), Pre-train method=OpenShape, Manual captions?=true, Zero-shot=true2023.05 | 84.4 | — | — | — | — | — | — | — | 98 | — | — | — | |
| OpenShapePre-training Data=Ensembled2024.02 | 84.4 | — | — | — | — | — | — | — | 98 | 96.5 | — | — | |
| OpenShapeTraining Dataset=Ensembled, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 84.4 | — | — | — | — | — | — | — | 98 | 96.5 | — | — | |
| Point-BERT (ULIP-2)Pre-train dataset=Objaverse(no LVIS) + ShapeNet, Pre-train method=ULIP-2, Manual captions?=false, Zero-shot=true2023.05 | 84 | — | — | — | — | — | — | — | 97.2 | — | — | — | |
| Point-BERT (OpenShape)Pre-train dataset=Objaverse(no LVIS) + ShapeNet, Pre-train method=OpenShape, Manual captions?=true, Zero-shot=true2023.05 | 83.9 | — | — | — | — | — | — | — | 97.6 | — | — | — | |
| Point-BERT (OpenShape)Pre-train dataset=Objaverse + ShapeNet, Pre-train method=OpenShape, Manual captions?=true, Zero-shot=true2023.05 | 82.6 | — | — | — | — | — | — | — | 96.9 | — | — | — | |
| CodeBind-VL2026.05 | 78.3 | — | — | — | — | — | — | — | 96.5 | — | — | — | |
| ULIP-2Pre-train dataset=ShapeNet, Pre-train method=ULIP-2, Manual captions?=false, Zero-shot=true2023.05 | 75.2 | — | — | — | — | — | — | — | 95 | — | — | — | |
| ULIP-2Pre-training Data=Ensembled2024.02 | 75.1 | — | — | — | — | — | — | — | 93.2 | 88.1 | — | — | |
| ULIP-2Training Dataset=Ensembled, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 75.1 | — | — | — | — | — | — | — | 93.2 | 88.1 | — | — | |
| ULIP-2Venue=CVPR 2024, Zero-shot=true2025.11 | 75 | — | — | — | — | — | — | — | 93.1 | 88 | — | — | |
| TAMMPre-training Data=ShapeNet2024.02 | 73.1 | — | — | — | — | — | — | — | 91.9 | 88.5 | — | — | |
| TAMMTraining Dataset=ShapeNet, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 73.1 | — | — | — | — | — | — | — | 91.9 | 88.5 | — | — | |
| MixCon3DPre-training Data=ShapeNet2024.02 | 72.6 | — | — | — | — | — | — | — | 91.3 | 87.1 | — | — | |
| MixCon3DTraining Dataset=ShapeNet, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 72.6 | — | — | — | — | — | — | — | 91.3 | 87.1 | — | — | |
| Point-BERT (OpenShape)Pre-train dataset=ShapeNet, Pre-train method=OpenShape, Manual captions?=true, Zero-shot=true2023.05 | 70.3 | — | — | — | — | — | — | — | 91.3 | — | — | — | |
| OpenShapePre-training Data=ShapeNet2024.02 | 70.3 | — | — | — | — | — | — | — | 91.3 | 86.9 | — | — | |
| OpenShapeTraining Dataset=ShapeNet, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 70.3 | — | — | — | — | — | — | — | 91.3 | 86.9 | — | — | |
| Point-BERT (ULIP)Pre-train dataset=Objaverse + ShapeNet, Pre-train method=ULIP, Manual captions?=true, Zero-shot=true2023.05 | 69.6 | — | — | — | — | — | — | — | 85.9 | — | — | — | |
| Point-BERT (ULIP)Pre-train dataset=Objaverse(no LVIS) + ShapeNet, Pre-train method=ULIP, Manual captions?=true, Zero-shot=true2023.05 | 68.6 | — | — | — | — | — | — | — | 86.4 | — | — | — | |
| PointCLIPv2Zero-shot=true2023.05 | 63.6 | — | — | — | — | — | — | — | 85 | — | — | — | |
| PointCLIPv2Protocol=2D Inference without 3D Training2024.02 | 63.6 | — | — | — | — | — | — | — | 85 | 77.9 | — | — | |
| PointCLIPv23D Training status=2D Inference without 3D Training, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 63.6 | — | — | — | — | — | — | — | 85 | 77.9 | — | — | |
| PointMLP + ULIPzero-shot=true, backbone=PointMLP2022.12 | 61.5 | — | — | — | — | — | — | — | 80.7 | — | — | — | |
| ReConPre-train dataset=ShapeNet, Pre-train method=ReCon, Zero-shot=true2023.05 | 61.2 | — | — | — | — | — | — | — | 78.1 | — | — | — | |
| RECONPre-training Data=ShapeNet2024.02 | 61.2 | — | — | — | — | — | — | — | 78.1 | 73.9 | — | — | |
| RECONTraining Dataset=ShapeNet, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 61.2 | — | — | — | — | — | — | — | 78.1 | 73.9 | — | — | |
| PointDicoBackbone=Transformer, Ensemb.=True, Zero-shot evaluation protocol=true2025.12 | 60.6 | — | — | — | — | — | — | — | — | — | — | — | |
| ULIPVenue=CVPR 2023, Zero-shot=true2025.11 | 60.5 | — | — | — | — | — | — | — | 84.5 | 79.1 | — | — | |
| PointBERT + ULIPzero-shot=true, backbone=PointBERT2022.12 | 60.4 | — | — | — | — | — | — | — | 84 | — | — | — | |
| ULIPPre-train dataset=ShapeNet, Pre-train method=ULIP, Manual captions?=true, Zero-shot=true2023.05 | 60.4 | — | — | — | — | — | — | — | 84 | — | — | — | |
| ULIPPre-training Data=ShapeNet2024.02 | 60.4 | — | — | — | — | — | — | — | 84.4 | 79 | — | — | |
| ULIPTraining Dataset=ShapeNet, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 60.4 | — | — | — | — | — | — | — | 84.4 | 79 | — | — | |
| PointNet++(msg) + ULIPzero-shot=true, backbone=PointNet++(msg)2022.12 | 58.4 | — | — | — | — | — | — | — | 78.2 | — | — | — | |
| PointDicoBackbone=Transformer, Ensemb.=False, Zero-shot evaluation protocol=true2025.12 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | |
| UNIALIGN2026.05 | 55.9 | — | — | — | — | — | — | — | 84.3 | — | — | — | |
| PointNet++(ssg) + ULIPzero-shot=true, backbone=PointNet++(ssg)2022.12 | 55.7 | — | — | — | — | — | — | — | 75.7 | — | — | — | |
| CLIP2PointPre-train dataset=ShapeNet, Pre-train method=CLIP2Point, Manual captions?=false, Zero-shot=true2023.05 | 49.5 | — | — | — | — | — | — | — | 81.2 | — | — | — | |
| CLIP2PointPre-training Data=ShapeNet2024.02 | 49.5 | — | — | — | — | — | — | — | 81.2 | 71.3 | — | — | |
| CLIP2PointTraining Dataset=ShapeNet, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 49.5 | — | — | — | — | — | — | — | 81.2 | 71.3 | — | — | |
| CLIP2PointBackbone=Transformer, Ensemb.=True, Zero-shot evaluation protocol=true2025.12 | 49.4 | — | — | — | — | — | — | — | — | — | — | — | |
| GPT4PointInput Data Type=Point Cloud (+Color), Zero-shot evaluation=true2023.12 | 43.9 | — | — | — | — | — | — | — | — | — | — | — | |
| PointLLM(Vicuna-7B)Input Data Type=Point Cloud (+Color), Zero-shot evaluation=true, Generative 3D object classification=true2023.12 | 41.33 | — | — | — | — | — | — | — | — | — | — | — | |
| BLIP-2Input Data Type=Single-View Image, Zero-shot evaluation=true2023.12 | 35.62 | — | — | — | — | — | — | — | — | — | — | — | |
| InstructBLIPInput Data Type=Mesh with Color, Zero-shot evaluation=true2023.12 | 31.48 | — | — | — | — | — | — | — | — | — | — | — | |
| PointCLIPzero-shot=true2022.12 | 20.2 | — | — | — | — | — | — | — | — | — | — | — | |
| PointCLIPBackbone=ResNet-50, Ensemb.=False, Zero-shot evaluation protocol=true2025.12 | 20.2 | — | — | — | — | — | — | — | — | — | — | — | |
| PointCLIPVenue=CVPR 2022, Zero-shot=true2025.11 | 19.4 | — | — | — | — | — | — | — | 34.9 | 28.5 | — | — | |
| PointCLIPZero-shot=true2023.05 | 19.3 | — | — | — | — | — | — | — | 34.8 | — | — | — | |
| PointCLIPProtocol=2D Inference without 3D Training2024.02 | 19.3 | — | — | — | — | — | — | — | 34.8 | 28.6 | — | — | |
| PointCLIP3D Training status=2D Inference without 3D Training, Teacher Backbone=OpenCLIP-bigG [30]2026.03 | 19.3 | — | — | — | — | — | — | — | 34.8 | 28.6 | — | — | |
| 3DGenZGenerative=true, Word Embeddings=W2V, Protocol=ZSL, Backbone=PointNet2021.08 | — | — | 28.6 | — | — | — | — | — | — | — | — | — | |
| 3DGenZGenerative=true, Word Embeddings=GloVe, Protocol=ZSL, Backbone=PointNet2021.08 | — | — | 29.3 | — | — | — | — | — | — | — | — | — | |
| 3DGenZGenerative=true, Word Embeddings=Glove + W2V, Protocol=ZSL, Backbone=PointNet2021.08 | — | — | 36.8 | — | — | — | — | — | — | — | — | — | |
| 3DGenZGenerative=true, Bias reduction=true, Word Embeddings=W2V, Protocol=GZSL, Backbone=PointNet2021.08 | — | — | — | — | — | 48.8 | 29.3 | 36.6 | — | — | — | — | |
| 3DGenZGenerative=true, Bias reduction=true, Word Embeddings=GloVe, Protocol=GZSL, Backbone=PointNet2021.08 | — | — | — | — | — | 44.7 | 28.4 | 34.7 | — | — | — | — | |
| 3DGenZGenerative=true, Bias reduction=true, Word Embeddings=Glove + W2V, Protocol=GZSL, Backbone=PointNet2021.08 | — | — | — | — | — | 47.8 | 36.5 | 41.3 | — | — | — | — | |
| 3DShapeNetsInput=voxels2019.01 | — | 0.847 | — | — | — | — | — | — | — | — | — | — | |
| ACTMasked Centers Leakage=true, Single/Cross-Modal=Cross, Pre-trained Model Needed=true, # Params=135.5, GFLOPS=23.0, Time (h)=34.82024.08 | — | 0.932 | — | — | — | — | — | — | — | — | — | — | |
| ACT#LP (M)=22.1, Training Protocol=Self-Supervised Pre-training + Full fine-tuning, PPT Setting=false2026.04 | — | — | — | — | — | — | — | — | — | — | 93.6 | — | |
| adapt weightsparam=19.4M, FLOP=2.3G2020.07 | — | 0.93 | — | — | — | — | — | — | — | — | — | — | |
| adapt weights (S)param=1.2M, FLOP=0.2G, Model Scale=Small2020.07 | — | 0.921 | — | — | — | — | — | — | — | — | — | — |