Image Classification on Oxford-IIIT
91AccuracyLOOPE (XG + XC)
Evaluation Results
| Method | Links | |
|---|---|---|
| LOOPE (XG + XC)Model=Cross-ViT [2]2025.04 | 91 | |
| LearnableModel=Cross-ViT [2]2025.04 | 90.9 | |
| LFF(Fourier)Backbone=DeiT-Base, Positional Encoding=LFF(Fourier)2025.04 | 90.5 | |
| LOOPE (XG + XC)Model=CaiT [29]2025.04 | 90.5 | |
| SinusoidModel=CaiT [29]2025.04 | 90 | |
| LOOPE (XG + Xc)Backbone=DeiT-Base, Positional Encoding=LOOPE (XG + Xc)2025.04 | 89.8 | |
| LOOPE (XG + XC)Model=DeiT-Base [28]2025.04 | 89.8 | |
| Static (XG)Model=CaiT [29]2025.04 | 89.6 | |
| LearnableModel=DeiT-Base [28]2025.04 | 89.4 | |
| Static (XG)Model=Cross-ViT [2]2025.04 | 89.3 | |
| Static (XG)Backbone=DeiT-Base, Positional Encoding=Static (XG)2025.04 | 89 | |
| Static (XG)Model=DeiT-Base [28]2025.04 | 89 | |
| LearnableModel=CaiT [29]2025.04 | 89 | |
| No PEModel=DeiT-Base [28]2025.04 | 88.9 | |
| AS2DRoPEBackbone=DeiT-Base, Positional Encoding=AS2DRoPE2025.04 | 88.7 | |
| No PEModel=Cross-ViT [2]2025.04 | 88.3 | |
| LOOPE (XG + XC)Model=ViT-Base [10]2025.04 | 88.1 | |
| SinusoidModel=Cross-ViT [2]2025.04 | 88 | |
| No PEModel=CaiT [29]2025.04 | 87.4 | |
| SinusoidModel=DeiT-Base [28]2025.04 | 86.3 | |
| SinusoidModel=ViT-Base [10]2025.04 | 85.3 | |
| LearnableModel=ViT-Base [10]2025.04 | 84.6 | |
| LOOPE (XG + XC)Model=DeiT-Small [28]2025.04 | 84.5 | |
| Static (XG)Model=ViT-Base [10]2025.04 | 84.2 | |
| CPEBackbone=DeiT-Base, Positional Encoding=CPE2025.04 | 83.9 | |
| No PEModel=DeiT-Small [28]2025.04 | 83.8 | |
| LearnableModel=DeiT-Small [28]2025.04 | 83.8 | |
| SinusoidModel=DeiT-Small [28]2025.04 | 83.7 | |
| No PEModel=ViT-Base [10]2025.04 | 83.6 | |
| Static (XG)Model=DeiT-Small [28]2025.04 | 80.6 | |
| RPEBackbone=DeiT-Base, Positional Encoding=RPE2025.04 | 80.5 | |
| 2D SinusoidBackbone=DeiT-Base, Positional Encoding=2D Sinusoid2025.04 | 80.1 |