Image Classification on ImageNet-1k (Top-1 and Delta Metrics)
87.5Top-1 AccuracyCAP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CAPArchitecture=ConvNeXt-L CLIP, Compression=50/60/70% unstructured, FT/train=0, Main comparison point=Closest high-accuracy ConvNeXt unstructured one-shot context; no endpoint speed row.2026.05 | 87.5 | 0.3 | |
| CAST 12:16Architecture=ConvNeXtV2-B, Compression=∼25% MAC-accounting, FT/train=3, Main comparison point=Main ConvNeXtV2 wider-pattern accuracy/MAC row; no native 12:16 endpoint audit.2026.05 | 86.35 | 0.37 | |
| CAST 8:16 dense+permArchitecture=ViT-L/16, Compression=8:16 = 50%, FT/train=3, Main comparison point=Main wider-pattern accuracy/MAC row; no native 8:16 endpoint audit.2026.05 | 85.33 | 0.51 | |
| Hybrid Mag–SERArchitecture=ConvNeXtV2-B, Compression=50/60/70% unstructured, FT/train=1/cycle, Main comparison point=This paper’s ConvNeXtV2 unstructured row with short-cycle FT.2026.05 | 85.33 | 1.39 | |
| ToMeArchitecture=ViT-L/16 MAE, Compression=token merging, FT/train=MAE FT, Main comparison point=Closest token-merging accuracy/speed context; not weight sparsity.2026.05 | 85.05 | 0.61 | |
| CAST 2:4+ToMeArchitecture=ViT-B/16, Compression=2:4+ToMe, FT/train=3, Main comparison point=Native A40 2:4 endpoint 1.388×; separate no-ToMe A100 endpoint 2.705×.2026.05 | 83.41 | 1.7 | |
| SparseFormerArchitecture=ViT-B/16 AugReg, Compression=latent-token reduction, FT/train=20+5 ep., Main comparison point=Similar accuracy but token reduction, not weight sparsity; 1.85× throughput.2026.05 | 83.4 | 1.2 | |
| Hybrid Mag–SERArchitecture=ViT-B/16, Compression=50% unstructured, FT/train=1/cycle, Main comparison point=MP-budgeted unstructured row with short-cycle FT.2026.05 | 83.37 | 1.74 | |
| CAST-conv+permArchitecture=ResNet152d, Compression=2:4 im2col, FT/train=3, Main comparison point=Main CNN sparse-GEMM audit; 1.617× A40 im2col, not cuDNN Conv2d.2026.05 | 81.33 | 1.53 | |
| MaskLLM (vision/4V)Architecture=ViT-B/16, Compression=2:4 learned mask, FT/train=20 mask ep., Main comparison point=Learned-mask ViT 2:4 context (MaskLLM vision/4V setting); weights frozen, no ViT endpoint speed reported.2026.05 | 79.46 | 0.31 | |
| AC/DCArchitecture=ResNet-50, Compression=50% unstructured, FT/train=100 train, Main comparison point=Strong global sparse training baseline; much longer training.2026.05 | 77.05 | 0.21 | |
| SNOWSArchitecture=ViT-B/16, Compression=2:4 QKV+Out+MLP, FT/train=0, Main comparison point=Closest one-shot ViT 2:4 row; MiniImageNet-1k subset, no endpoint speed row.2026.05 | 76.57 | 3.85 | |
| Pool–Yu perm.Architecture=ResNet-50, Compression=2:4+perm, FT/train=repeated train/FT, Main comparison point=Closest channel-permutation semi-structured ResNet context (no inference-time overhead).2026.05 | 76.29 | 0.13 | |
| Mishra et al.Architecture=ResNet-50, Compression=2:4 FP16, FT/train=repeated train, Main comparison point=Original 2:4 sparse Tensor Core reference; up to 2× sparse math.2026.05 | 76.2 | 0.1 | |
| UniPTSArchitecture=ResNet-50, Compression=50/60/70% unstructured, FT/train=16k iters, Main comparison point=Closest post-training unstructured ResNet row with limited calibration.2026.05 | 75.76 | 0.36 | |
| Hybrid Mag–SERArchitecture=ResNet50, Compression=50/60/70% unstructured, FT/train=1/cycle, Main comparison point=This paper’s matched short-cycle unstructured ResNet sweep.2026.05 | 75.76 | 0.37 |