Event-based Image Retrieval on OpenEvents v1 (public test)
0.559mAPLightweight Entity-Guided Event-Based Image Retrieval
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Lightweight Entity-Guided Event-Based Image RetrievalBackbone=BEiT-3, Filtering=Entity-driven + BM25, Reranking Strategy=BEiT-3 based2025.12 | 0.559 | 0.559 | 0.454 | 0.702 | 0.76 | 0.5727 | |
| SBERT + Bart + CLIPText Embedding=SBERT, Language Model=Bart, Vision Model=CLIP2025.12 | 0.3232 | — | — | — | — | — | |
| SBERT + Pegasus + CLIPText Embedding=SBERT, Language Model=Pegasus, Vision Model=CLIP2025.12 | 0.3216 | — | — | — | — | — | |
| SBERT + PegasusText Embedding=SBERT, Language Model=Pegasus2025.12 | 0.2868 | — | — | — | — | — | |
| SBERT + BartText Embedding=SBERT, Language Model=Bart2025.12 | 0.284 | — | — | — | — | — | |
| SBERT + FlanT5 + CLIPText Embedding=SBERT, Language Model=FlanT5, Vision Model=CLIP2025.12 | 0.2795 | — | — | — | — | — | |
| CLIPArchitecture=Vision-Language Model2025.12 | 0.2467 | — | — | — | — | — | |
| SBERT + FlanT5Text Embedding=SBERT, Language Model=FlanT52025.12 | 0.2134 | — | — | — | — | — | |
| OpenCLIPArchitecture=Vision-Language Model2025.12 | 0.1845 | — | — | — | — | — |