Image-to-Text Cross-lingual Retrieval on OOD handwriting set
73.55Accuracy@1 (en->zh)lightweight asymmetric dual-encoder framework
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| lightweight asymmetric dual-encoder framework2026.01 | 73.55 | 84.96 | 83.88 | 90.36 | 90.98 | 73.66 | 82.8 | |
| GME-Qwen2VLModel Size=7B2026.01 | 42.05 | 57.36 | 44.63 | 32.26 | 50.42 | 30.62 | 42.89 | |
| SigLIP 2Model Size=Giant2026.01 | 36.89 | 6.71 | 8.26 | 29.45 | 52.59 | 31.58 | 27.55 | |
| GME-Qwen2VLModel Size=2B2026.01 | 30.53 | 48.79 | 30.1 | 33.2 | 42.4 | 17.58 | 33.77 | |
| SigLIP 2Model Size=So400m2026.01 | 27.93 | 1.68 | 1.32 | 27.97 | 41.25 | 24.67 | 20.8 | |
| Chinese CLIPBackbone=ViT Huge2026.01 | 13.79 | 9.33 | 2.06 | 12.61 | 23.33 | 2.66 | 10.63 | |
| Random2026.01 | 0.34 | 0.26 | 0.29 | 0.3 | 0.4 | 0.3 | 0.32 |