Image Classification on EUROSAT (Accuracy %)
99Accuracytheta_B fine-tune
Evaluation Results
| Method | Links | |
|---|---|---|
| theta_B fine-tuneModel=ViT-L/14, Mode=fine-tune2026.02 | 99 | |
| theta_B fine-tuneModel=laion400m, Protocol=fine-tune2026.02 | 98.96 | |
| theta_B fine-tuneBackbone=ViT-L/142025.10 | 98.95 | |
| theta_B fine-tuneBackbone=ViT-B/162025.10 | 98.7 | |
| theta_A fine-tuneModel=laion2b, Protocol=fine-tune2026.02 | 98.69 | |
| theta_A fine-tuneModel=ViT-B/16, Mode=fine-tune2026.02 | 98.66 | |
| theta_B + delta_starBackbone=ViT-L/142025.10 | 96.75 | |
| theta_B + delta_starBackbone=ViT-B/162025.10 | 95.06 | |
| THESEUSModel=ViT-L/14, B (alignment batches)=102026.02 | 76.78 | |
| GradFix (theta_B + delta_A)Backbone=ViT-L/14, |Ds_c|=52025.10 | 75.59 | |
| GradFix (theta_B + delta_A)Backbone=ViT-L/14, |Ds_c|=22025.10 | 74.1 | |
| theta_B_opt (Few-shot fine-tuning)Backbone=ViT-L/14, |Ds_c|=22025.10 | 70.76 | |
| theta_B_opt (Few-shot fine-tuning)Backbone=ViT-L/14, |Ds_c|=52025.10 | 69.75 | |
| GradFix (theta_B + delta_A)Backbone=ViT-L/14, |Ds_c|=12025.10 | 69.67 | |
| theta_B zero-shotModel=ViT-L/14, Mode=zero-shot2026.02 | 68.4 | |
| THESEUSK=20, Width Scaling Direction=laion2b to laion400m2026.02 | 66.83 | |
| GradFix (theta_B + delta_A)Backbone=ViT-B/16, |Ds_c|=52025.10 | 66.05 | |
| THESEUSK=10, Width Scaling Direction=laion2b to laion400m2026.02 | 65.51 | |
| GradFix (theta_B + delta_A)Backbone=ViT-B/16, |Ds_c|=22025.10 | 65.07 | |
| theta_B_opt (Few-shot fine-tuning)Backbone=ViT-L/14, |Ds_c|=12025.10 | 64.65 | |
| THESEUSK=5, Width Scaling Direction=laion2b to laion400m2026.02 | 64.58 | |
| TransFusionBackbone=ViT-L/142025.10 | 63.21 | |
| theta_B zero-shotBackbone=ViT-L/142025.10 | 62.8 | |
| theta_B + tau_ABackbone=ViT-L/142025.10 | 62.77 | |
| theta_B_opt (Few-shot fine-tuning)Backbone=ViT-B/16, |Ds_c|=52025.10 | 61.99 | |
| GradFix (theta_B + delta_A)Backbone=ViT-B/16, |Ds_c|=12025.10 | 61.94 | |
| THESEUSK=2, Width Scaling Direction=laion2b to laion400m2026.02 | 61.46 | |
| THESEUSK=1, Width Scaling Direction=laion2b to laion400m2026.02 | 60.79 | |
| theta_B_opt (Few-shot fine-tuning)Backbone=ViT-B/16, |Ds_c|=22025.10 | 59.49 | |
| theta_B_opt (Few-shot fine-tuning)Backbone=ViT-B/16, |Ds_c|=12025.10 | 56.61 | |
| CLIP ViT-B/16Img. encoder=CLIP ViT-B/162026.05 | 51.93 | |
| theta_B zero-shotModel=laion400m, Protocol=zero-shot2026.02 | 50.92 | |
| TransFusionBackbone=ViT-B/162025.10 | 50.12 | |
| theta_B + tau_ABackbone=ViT-B/162025.10 | 49.58 | |
| theta_B zero-shotBackbone=ViT-B/162025.10 | 49.41 | |
| CLIP ViT-B/32Img. encoder=CLIP ViT-B/322026.05 | 34.44 | |
| CLIP RN-50Img. encoder=CLIP RN-502026.05 | 28 | |
| ConvFormer-S18 + MPNetImg. encoder=ConvFormer-S18, Txt. encoder=MPNet2026.05 | 27 | |
| CLIP RN-101Img. encoder=CLIP RN-1012026.05 | 26.7 | |
| TinyViT-21M + CLIPImg. encoder=TinyViT-21M, Txt. encoder=CLIP2026.05 | 26.48 | |
| TinyViT-21M + MPNetImg. encoder=TinyViT-21M, Txt. encoder=MPNet2026.05 | 25.56 | |
| TinyViT-21M + MiniLMImg. encoder=TinyViT-21M, Txt. encoder=MiniLM2026.05 | 24.93 | |
| ConvNext-B + CLIPImg. encoder=ConvNext-B, Txt. encoder=CLIP2026.05 | 24.78 | |
| ConvFormer-S18 + CLIPImg. encoder=ConvFormer-S18, Txt. encoder=CLIP2026.05 | 23.93 | |
| BEiT-B/16 + CLIPImg. encoder=BEiT-B/16, Txt. encoder=CLIP2026.05 | 23.67 | |
| ConvNext-B + MPNetImg. encoder=ConvNext-B, Txt. encoder=MPNet2026.05 | 23.63 | |
| CAFormer-S18 + CLIPImg. encoder=CAFormer-S18, Txt. encoder=CLIP2026.05 | 22.7 | |
| TinyViT-21M + RoBERTaImg. encoder=TinyViT-21M, Txt. encoder=RoBERTa2026.05 | 21.48 | |
| CAFormer-S18 + RoBERTaImg. encoder=CAFormer-S18, Txt. encoder=RoBERTa2026.05 | 20.7 | |
| CAFormer-S18 + MPNetImg. encoder=CAFormer-S18, Txt. encoder=MPNet2026.05 | 20.48 | |
| ConvNext-B + RoBERTaImg. encoder=ConvNext-B, Txt. encoder=RoBERTa2026.05 | 19.15 | |
| ConvFormer-S18 + MiniLMImg. encoder=ConvFormer-S18, Txt. encoder=MiniLM2026.05 | 18.59 | |
| BEiT-B/16 + MPNetImg. encoder=BEiT-B/16, Txt. encoder=MPNet2026.05 | 18.15 | |
| CAFormer-S18 + MiniLMImg. encoder=CAFormer-S18, Txt. encoder=MiniLM2026.05 | 17.37 | |
| BEiT-B/16 + RoBERTaImg. encoder=BEiT-B/16, Txt. encoder=RoBERTa2026.05 | 17.15 | |
| ConvNext-B + MiniLMImg. encoder=ConvNext-B, Txt. encoder=MiniLM2026.05 | 17 | |
| ConvFormer-S18 + RoBERTaImg. encoder=ConvFormer-S18, Txt. encoder=RoBERTa2026.05 | 16.44 | |
| BEiT-B/16 + MiniLMImg. encoder=BEiT-B/16, Txt. encoder=MiniLM2026.05 | 12.85 |