Single-conditional Image Retrieval on Stanford40
72.2Action AccuracyCLAY
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CLAYBase Model=SigLIP-L, Backbone=ViT-L2026.04 | 72.2 | 60 | 62 | |
| CLAYBase Model=CLIP-L, Backbone=ViT-L2026.04 | 68.9 | 55.5 | 63.2 | |
| CLAYBackbone=SigLIP-B2026.04 | 66.2 | 59.5 | 58.7 | |
| CLAYBackbone=CLIP-B2026.04 | 66 | 55.4 | 57.9 | |
| InstructBLIP2026.04 | 63.1 | 54.4 | 60.3 | |
| SigLIP-LBackbone=ViT-L2026.04 | 56.5 | 51.3 | 56.7 | |
| SigLIP-BBackbone=SigLIP-B2026.04 | 54.8 | 52.7 | 56.4 | |
| MagicLens2026.04 | 52.6 | 47.5 | 55.4 | |
| GeneCIS2026.04 | 50 | 50.9 | 51.8 | |
| CLIP-LBackbone=ViT-L2026.04 | 45.3 | 44.1 | 54 | |
| CLIP-BBackbone=CLIP-B2026.04 | 43 | 47 | 53 | |
| SEARLE2026.04 | 40.5 | 43.2 | 50 |