Visual Attribution on ImageNet Predicted Class target ILSVRC 2012 (val)
0.2858Deletion ScoreGrad-CAM
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Grad-CAMBackbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.2858 | 0.4982 | 0.2124 | 0.3346 | 0.5788 | 0.2442 | 84.3339 | 4.3577 | 0.014 | |
| IGBackbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.1857 | 0.5544 | 0.3686 | 0.2248 | 0.6347 | 0.4099 | 22.934 | 33.4353 | 0.251 | |
| ViT-CXBackbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.175 | 0.5714 | 0.3964 | 0.2149 | 0.6478 | 0.4328 | 12.5472 | 43.4971 | 0.86 | |
| LeGradBackbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.1666 | 0.5666 | 0.4 | 0.2036 | 0.6461 | 0.4425 | 20.385 | 34.344 | 0.006 | |
| Trans-Att.Backbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.1654 | 0.5833 | 0.4178 | 0.2022 | 0.6654 | 0.4633 | 25.6994 | 30.8467 | 0.254 | |
| Bi-Att.Backbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.16 | 0.5958 | 0.4358 | 0.1961 | 0.6789 | 0.4828 | 28.4572 | 28.2614 | 0.254 | |
| MDABackbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.1556 | 0.6112 | 0.4556 | 0.1933 | 0.6983 | 0.505 | 48.6653 | 13.2691 | 13.645 | |
| TISBackbone=ViT-B/16, Reference image modes=black, mean, blur2026.04 | 0.142 | 0.6381 | 0.4961 | 0.1731 | 0.7222 | 0.5492 | 11.2479 | 45.5658 | 1.167 | |
| AHABackbone=ViT-B/16, Reference image modes=black, mean, blur, Refinement steps (T)=02026.04 | 0.1381 | 0.6112 | 0.4731 | 0.1714 | 0.6947 | 0.5233 | 15.8713 | 36.8246 | 0.016 | |
| AHABackbone=ViT-B/16, Reference image modes=black, mean, blur, Refinement steps (T)=32026.04 | 0.1215 | 0.6485 | 0.5271 | 0.1491 | 0.7378 | 0.5887 | 12.4658 | 42.2698 | 0.547 |