Zero-shot Classification on ModelNet40
85.4AccuracyE-3DSNN-H
Evaluation Results
| Method | Links | |
|---|---|---|
| E-3DSNN-HArchitecture=SNN, Pre-train Method=SVL (Ours), Input=Voxel, T × D=1×4, Point+Text Param (M)=46.7, Energy (mJ)=0.792025.05 | 85.4 | |
| Point-BertArchitecture=ANN, Pre-train Method=Ulip2 (Xue et al., 2024), Input=Point, T × D=N/A, Point+Text Param (M)=21.9+202.5, Energy (mJ)=83.7+71.72025.05 | 84.7 | |
| E-3DSNN-LArchitecture=SNN, Pre-train Method=SVL (Ours), Input=Voxel, T × D=1×4, Point+Text Param (M)=17.7, Energy (mJ)=0.642025.05 | 84.6 | |
| SparseconvArchitecture=ANN, Pre-train Method=Openshape (Liu et al., 2023b), Input=Voxel, T × D=N/A, Point+Text Param (M)=41.3+202.5, Energy (mJ)=2.13+71.72025.05 | 83.4 | |
| Spike-driven PointFormer-LArchitecture=SNN, Pre-train Method=SVL (Ours), Input=Point, T × D=1×4, Point+Text Param (M)=22.1, Energy (mJ)=9.42025.05 | 83.1 | |
| Point-BertArchitecture=ANN, Pre-train Method=Openshape (Liu et al., 2023b), Input=Point, T × D=N/A, Point+Text Param (M)=21.9+202.5, Energy (mJ)=83.2+71.72025.05 | 82.8 | |
| Spike-driven PointFormer-SArchitecture=SNN, Pre-train Method=SVL (Ours), Input=Point, T × D=1×4, Point+Text Param (M)=7.69, Energy (mJ)=5.12025.05 | 82.1 | |
| E-3DSNN-SArchitecture=SNN, Pre-train Method=SVL (Ours), Input=Voxel, T × D=1×4, Point+Text Param (M)=3.51, Energy (mJ)=0.092025.05 | 81.3 | |
| E-3DSNN-TArchitecture=SNN, Pre-train Method=SVL (Ours), Input=Voxel, T × D=1×4, Point+Text Param (M)=2.10, Energy (mJ)=0.042025.05 | 79.6 | |
| SparseconvArchitecture=ANN, Pre-train Method=Openshape (Liu et al., 2023b), Input=Voxel, T × D=N/A, Point+Text Param (M)=5.3+202.5, Energy (mJ)=0.61+71.72025.05 | 78.8 | |
| Spike PointNetArchitecture=SNN, Pre-train Method=SVL (Ours), Input=Point, T × D=1×4, Point+Text Param (M)=3.57, Energy (mJ)=0.272025.05 | 76.3 | |
| PointNetArchitecture=ANN, Pre-train Method=Openshape (Liu et al., 2023b), Input=Point, T × D=N/A, Point+Text Param (M)=3.47+202.5, Energy (mJ)=20.1+71.72025.05 | 74.9 | |
| Point-BertArchitecture=ANN, Pre-train Method=Ulip (Xue et al., 2023), Input=Point, T × D=N/A, Point+Text Param (M)=21.9+227.8, Energy (mJ)=81.2+80.62025.05 | 69.6 | |
| PointCLIP V2Backbone=ViT-B/32, Hardware=1 RTX A6000, GFLOPS=16.51, Memory (GB)=29672022.11 | 55.92 | |
| CLIP2PointBackbone=ViT-B/32, Hardware=1 RTX A6000, GFLOPS=16.46, Memory (GB)=30062022.11 | 49.38 | |
| PointCLIPArchitecture=ANN, Pre-train Method=N/A, Input=Image, T × D=N/A, Point+Text Param (M)=25.5+57.3, Energy (mJ)=24.9+20.32025.05 | 20.2 | |
| PointCLIPBackbone=ViT-B/32, Hardware=1 RTX A6000, GFLOPS=16.46, Memory (GB)=29012022.11 | 16.94 | |
| SpikeCLIP*Architecture=SNN, Pre-train Method=N/A, Input=Image, T × D=4×1, Point+Text Param (M)=9.5+22.8, Energy (mJ)=10.6+0.412025.05 | 5.1 |