Domain-incremental Learning on DomainNet (Transfer, Avg., Last)
75.2Last Step AccuracyDIMoE-Adapters
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DIMoE-Adapterscomponents=PGES and SCEE2026.05 | 75.2 | 57 | 68.6 | — | — | — | |
| MoE-Adapters2026.05 | 72.5 | 56.03 | 66.22 | — | — | — | |
| E2-LoRABackbone=ViT-B/16-IN1K2026.05 | 69.63 | — | — | 68.69 | — | — | |
| ZSCL2026.05 | 68.73 | 55.74 | 65.13 | — | — | — | |
| WiSE-FT2026.05 | 67.95 | 54.02 | 64.57 | — | — | — | |
| DUCTBackbone=ViT-B/16-IN1K2026.05 | 67.01 | — | — | 67.16 | — | — | |
| LwF-VR2026.05 | 66.95 | 53.57 | 64.03 | — | — | — | |
| LwF2026.05 | 66.13 | 52.54 | 63.14 | — | — | — | |
| DCEBackbone=ViT-B/16-IN1K2026.05 | 63.5 | — | — | 64.3 | — | — | |
| Zero-shotmode=zero-shot2026.05 | 60.79 | 57.86 | 60.79 | — | — | — | |
| CODA-PromptBackbone=ViT-B/16-IN1K2026.05 | 59.99 | — | — | 59.85 | — | — | |
| MEMOBackbone=ViT-B/16-IN1K2026.05 | 58.41 | — | — | 61.92 | — | — | |
| Full Fine-tunestrategy=continual fine-tuning without forgetting mitigation2026.05 | 56.09 | 51.25 | 59.03 | — | — | — | |
| RanPACBackbone=ViT-B/16-IN1K2026.05 | 54.8 | — | — | 55.2 | — | — | |
| DualPromptBackbone=ViT-B/16-IN1K2026.05 | 50.46 | — | — | 52.28 | — | — | |
| L2PBackbone=ViT-B/16-IN1K2026.05 | 48.72 | — | — | 50.45 | — | — | |
| SimpleCILBackbone=ViT-B/16-IN1K2026.05 | 44.08 | — | — | 42.95 | — | — | |
| EASEBackbone=ViT-B/16-IN1K2026.05 | 43.72 | — | — | 50.5 | — | — | |
| CODA-PModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 54.29 | 1.34 | |
| CoVONModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 59.89 | 1.61 | |
| CoVONModel=CLIP with pretrained ViT-B/16 as vision encoder2026.06 | — | — | — | — | 70.59 | 0.53 | |
| CoVON-NoMModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 58.96 | 1.86 | |
| DualPromptModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 43.79 | 2.03 | |
| DyToxModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 62.94 | — | |
| EWCModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 47.62 | 1.93 | |
| EWC*Model=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 51.01 | 1.79 | |
| L2PModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 40.15 | 2.25 | |
| LwFModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 45.01 | 1.99 | |
| MoP-CLIPModel=CLIP with pretrained ViT-B/16 as vision encoder2026.06 | — | — | — | — | 69.7 | 0.76 | |
| PINAModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 54.86 | 2.24 | |
| PINAModel=CLIP with pretrained ViT-B/16 as vision encoder2026.06 | — | — | — | — | 66 | 1.59 | |
| S-iPromptsModel=Vision Transformer (ViT-B/16)2026.06 | — | — | — | — | 50.62 | 2.85 | |
| S-liPromptsModel=CLIP with pretrained ViT-B/16 as vision encoder2026.06 | — | — | — | — | 68.55 | 1.64 |