Interaction Recognition on ImageNet-1k 2 objects
88Interaction RecognitionMETAGAME
Evaluation Results
| Method | Links | |
|---|---|---|
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=MaskCLIP2026.05 | 88 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=MaskSigLIP2026.05 | 88 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=MaskSigLIP2026.05 | 88 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=Attention2026.05 | 87 | |
| FIxLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 87 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=Grad-ESigLIP2026.05 | 85 | |
| METAGAMEModel (Size)=MetaCLIP-2 (ViT-H/14), Explanation Basis=Attention2026.05 | 83 | |
| FIxLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 83 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=Grad-ESigLIP2026.05 | 80 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=Grad-ECLIP2026.05 | 79 | |
| FIxLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 77 | |
| METAGAMEModel (Size)=MetaCLIP-2 (ViT-H/14), Explanation Basis=Grad-ECLIP2026.05 | 76 | |
| MaskSigLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 73 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=Attention2026.05 | 71 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=Attention2026.05 | 67 | |
| FIxLIPModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 66 | |
| MaskSigLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 54 | |
| Grad-ESigLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 48 | |
| AttentionModel (Size)=CLIP (ViT-B/16)2026.05 | 46 | |
| AttentionModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 45 | |
| Grad-ECLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 43 | |
| Grad-ECLIPModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 43 | |
| Grad-ESigLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 42 | |
| AttentionModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 39 | |
| AttentionModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 36 | |
| MaskCLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 28 |