Image Classification on Tiny-ImageNet 2015
36.16AccuracyViT + DiffusionBlocks
Evaluation Results
| Method | Links | |
|---|---|---|
| ViT + DiffusionBlocksBackbone=Vision Transformer, Layers=12, Blocks (B)=2, Layers per Block=6, Patch Size=4, Hidden Size=768, Attention Heads=12, Epochs=100, Batch Size=2562025.06 | 36.16 | |
| ViTBackbone=Vision Transformer, Layers=12, Patch Size=4, Hidden Size=768, Attention Heads=12, Epochs=100, Batch Size=2562025.06 | 35.32 |