Interaction Recognition on ImageNet-1k 1 object
89Interaction RecognitionMaskSigLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| MaskSigLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 89 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=MaskSigLIP2026.05 | 89 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=MaskSigLIP2026.05 | 88 | |
| FIxLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 87 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=MaskCLIP2026.05 | 86 | |
| METAGAMEModel (Size)=MetaCLIP-2 (ViT-H/14), Explanation Basis=Attention2026.05 | 85 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=Attention2026.05 | 84 | |
| AttentionModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 84 | |
| FIxLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 80 | |
| METAGAMEModel (Size)=MetaCLIP-2 (ViT-H/14), Explanation Basis=Grad-ECLIP2026.05 | 79 | |
| AttentionModel (Size)=CLIP (ViT-B/16)2026.05 | 77 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=Grad-ECLIP2026.05 | 76 | |
| FIxLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 76 | |
| Grad-ECLIPModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 76 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=Grad-ESigLIP2026.05 | 75 | |
| Grad-ECLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 71 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=Grad-ESigLIP2026.05 | 71 | |
| FIxLIPModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 70 | |
| Grad-ESigLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 68 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=Attention2026.05 | 60 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=Attention2026.05 | 57 | |
| Grad-ESigLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 54 | |
| MaskSigLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 53 | |
| AttentionModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 50 | |
| AttentionModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 47 | |
| MaskCLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 30 |