Interaction Recognition on ImageNet 1k (3 objects)
90Interaction Recognition AccuracyMETAGAME
Evaluation Results
| Method | Links | |
|---|---|---|
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=MaskSigLIP2026.05 | 90 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=Attention2026.05 | 89 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=MaskCLIP2026.05 | 89 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=Grad-ESigLIP2026.05 | 89 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=MaskSigLIP2026.05 | 88 | |
| FIxLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 87 | |
| METAGAMEModel (Size)=MetaCLIP-2 (ViT-H/14), Explanation Basis=Attention2026.05 | 85 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=Grad-ESigLIP2026.05 | 84 | |
| METAGAMEModel (Size)=CLIP (ViT-B/16), Explanation Basis=Grad-ECLIP2026.05 | 82 | |
| FIxLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 81 | |
| FIxLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 78 | |
| METAGAMEModel (Size)=MetaCLIP-2 (ViT-H/14), Explanation Basis=Grad-ECLIP2026.05 | 78 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-B/32), Base Method=Attention2026.05 | 78 | |
| METAGAMEModel (Size)=SigLIP-2 (ViT-L/16), Base Method=Attention2026.05 | 76 | |
| FIxLIPModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 73 | |
| MaskSigLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 54 | |
| MaskSigLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 42 | |
| Grad-ESigLIPModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 33 | |
| AttentionModel (Size)=CLIP (ViT-B/16)2026.05 | 32 | |
| AttentionModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 32 | |
| Grad-ECLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 31 | |
| Grad-ECLIPModel (Size)=MetaCLIP-2 (ViT-H/14)2026.05 | 31 | |
| Grad-ESigLIPModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 31 | |
| AttentionModel (Size)=SigLIP-2 (ViT-B/32)2026.05 | 30 | |
| AttentionModel (Size)=SigLIP-2 (ViT-L/16)2026.05 | 29 | |
| MaskCLIPModel (Size)=CLIP (ViT-B/16)2026.05 | 27 |